در دنیای هوش مصنوعی، مدلهای زبانی بزرگ (LLM) تاکنون تقریباً بهطور انحصاری بر پایه معماری خودبازگشتی (Autoregressive) توسعه یافتهاند؛ روشی که کلمات را به ترتیب و تکبهتک پیشبینی میکند. اگرچه این رویکرد به خلق ابزارهایی شگفتانگیز چون ChatGPT و Claude انجامید، اما محدودیتهایی نظیر سرعت پایین در تولید متنهای طولانی و هزینههای سرسامآور پردازش همواره از چالشهای بنیادین آن بودهاند.
بهتازگی پژوهشگران با معرفی معماری «سیگما» (Sigma) و مدلهای زبانی دیفیوژن پیوسته (Continuous Diffusion)، گامی تاریخی برای عبور از این محدودیتها برداشتهاند. این پیشرفت نهتنها امکان تولید موازی و فوقسریع متن را ممکن میسازد، بلکه در حل مسائل پیچیده استدلالی و کدنویسی نیز همپای برترین مدلهای کنونی جهان ظاهر شده است.
چرا مدلهای متنی به سراغ دیفیوژن رفتند؟
مدلهای دیفیوژن پیش از این دنیای تولید تصویر و ویدیو را با ابزارهایی مانند Midjourney و Stable Diffusion متحول کرده بودند. با این حال، انتقال این فناوری به حوزه متن همیشه با یک سد بزرگ مواجه بود: ماهیت «گسسته» زبان. تصویر از پیکسلهای پیوسته تشکیل شده، در حالی که کلمات واحدهایی جداگانه و مشخص (توکن) هستند.
تلاشهای اولیه برای ساخت مدلهای دیفیوژن زبانی گسسته (Discrete dLMs) نشان داد که این مدلها گرچه در تولید موازی سریع هستند، اما به دلیل فضای غیرپیوسته و ناهموار ریاضی، در استدلالهای عمیق، حل مسائل ریاضی و هدایت دقیق محتوا عملکرد ضعیفتری نسبت به مدلهای سنتی ثبت میکنند.
سیگما (Sigma)؛ گشایش عصر مدلهای دیفیوژن پیوسته
پژوهشگران در مقاله جدید خود از مدل Sigma در مقیاسهای ۳ میلیارد و ۸ میلیارد پارامتری رونمایی کردند. سیگما نخستین مدل در مقیاس بزرگ است که به جای دستکاری مستقیم توکنهای گسسته، فرایند دیفیوژن را در فضای پیوسته برداری (Continuous Latent Space) و بر پایه معادلات دیفرانسیل تصادفی (SDE/ODE) اجرا میکند.
سیگما فرایند تولید متن را مشابه صیقل دادن یک مجسمه انجام میدهد: ابتدا کل متن بهصورت یک نویز پیوسته گاوسی در نظر گرفته میشود و سپس مدل در چندین مرحله موازی، نویز را از بردارهای معنایی حذف کرده و متن نهایی، یکپارچه و دقیق را پدید میآورد.
نوآوریهای فنی کلیدی در معماری سیگما
- شروع گرم با وزنهای پیشآموزشدیده (Warm-starting): سیگما برای کاهش هزینههای نجومی آموزش اولیه، از وزنهای مدلهای خودبازگشتی استاندارد بهره میبرد و بدون نیاز به آموزش از صفر، ساختار دیفیوژن پیوسته را پیاده میکند.
- هدایتپذیری بالا (Steerability): پیوستگی فضا به مدل اجازه میدهد با استفاده از تکنیک هدایت بدون طبقهبندیکننده (Classifier-Free Guidance)، کنترل دقیقی روی کیفیت، تنوع و وفاداری پاسخ داشته باشد.
- افت کیفی نرم (Graceful Degradation): برخلاف مدلهای کلاسیک، در سیگما میتوان با کاهش گامهای محاسباتی (NFE)، سرعت پاسخدهی را به شکلی چشمگیر افزایش داد بدون آنکه معنای متن بهیکباره متلاشی شود.
مقایسه عملکرد سیگما با مدلهای سنتی و گسسته
یکی از بزرگترین دستاوردهای این پژوهش، اثبات توانایی مدلهای دیفیوژن پیوسته در بنچمارکهای سخت ریاضی و برنامهنویسی است؛ حوزههایی که پیش از این پاشنه آشیل مدلهای غیرخودبازگشتی محسوب میشدند.
| شاخص و بنچمارک | مدلهای سنتی (AR) | دیفیوژن گسسته (Discrete) | مدل پیوسته سیگما (Sigma) |
|---|---|---|---|
| نحوه تولید متن | کلمه به کلمه (ترتیبی) | موازی در فضای گسسته | موازی در مسیرهای پیوسته ODE |
| استدلال ریاضی (GSM8K / MATH-500) | بسیار قوی | ضعیف تا متوسط | رقابتی و همسطح مدلهای برتر |
| تولید کد (HumanEval / MBPP) | دقت بالا | دقت متوسط | بسیار دقیق و با وفاداری بالا |
| پتانسیل کاهش تأخیر (Latency) | محدود | بالا ولی با افت کیفیت | بسیار بالا و قابل تقطیر (Distillation) |

تأثیر این دستاورد بر بازار هوش مصنوعی و مصرف انرژی
تحول معماری مدلها به سمت دیفیوژن پیوسته فراتر از یک بحث آکادمیک است و پیامدهای اقتصادی مستقیمی برای غولهای فناوری دارد:
- کاهش مصرف انرژی دیتاسنترها: تولید موازی متن به این معناست که چیپهای شتابدهنده گرافیکی (GPU) زمان کمتری را در حالت آمادهباش برای پیشبینی کلمه بعدی صرف میکنند که این امر هزینه مقیاسپذیری هوش مصنوعی را کاهش میدهد.
- پاسخدهی در لحظه در دستگاههای همراه: امکان اجرای استنباط با گامهای محاسباتی کم، راه را برای اجرای دستیارهای هوشمند فوقسریع روی گوشیهای هوشمند و لپتاپها بدون نیاز به اتصال دائم به سرور ابری هموار میکند.
- تنوعپذیری پاسخها در کدنویسی: سیگما به دلیل قابلیت کنترل تعادل کیفیت و تنوع در فضای پیوسته، در تولید چند راهحل مختلف برای یک مسئله برنامهنویسی (معیار pass@k) خروجی بهتری ثبت کرده است.
معماری دیفیوژن پیوسته اثبات کرد که زبان طبیعی را میتوان مانند تصاویر در فضایی یکپارچه، پیوسته و منعطف مدلسازی کرد؛ نقطهعطفی که شاید مسیر توسعه LLMها را از سال ۲۰۲۶ به بعد بازتعریف کند.
جمعبندی
معرفی مدل Sigma و اثبات موفقیت دیفیوژن پیوسته در ابعاد چندمیلیاردی نشان میدهد که انحصار مدلهای خودبازگشتی در پردازش زبان طبیعی رو به پایان است. این رویکرد جدید با ترکیب سرعت خارقالعاده تولید موازی و دقت استدلالی بالا، افق جدیدی برای کاهش هزینههای پردازشی و افزایش سرعت ابزارهای هوش مصنوعی ترسیم میکند. در ماههای آینده، باید دید آیا شرکتهای بزرگی نظیر متا، اوپنایآی و گوگل این معماری را به محصولات تجاری خود وارد خواهند کرد یا خیر.
سؤالات متداول
مدل زبانی دیفیوژن پیوسته (Continuous dLM) چه تفاوتی با مدلهای فعلی مثل ChatGPT دارد؟
مدلهای فعلی کلمات را یکی پس از دیگری و بهصورت زنجیرهای تولید میکنند، اما مدلهای دیفیوژن پیوسته ابتدا کل ساختار متن را بهصورت یک فضای نویز برداری در نظر گرفته و در چند مرحله موازی نویززدایی میکنند که سرعت و پتانسیل بهینهسازی بسیار بالاتری دارد.
مدل سیگما (Sigma) در چه ابعادی معرفی شده است؟
این مدل در نسخههای ۳ میلیارد (3B) و ۸ میلیارد (8B) پارامتری توسعه یافته و عملکرد آن در استدلالهای ریاضی و کدنویسی همسطح مدلهای مطرح موجود ارزیابی شده است.
آیا این فناوری به معنای سریعتر شدن پاسخهای هوش مصنوعی است؟
بله؛ به دلیل قابلیت پردازش موازی و کاهش گامهای محاسباتی بدون افت شدید کیفیت، این معماری میتواند تأخیر (Latency) در تولید متنهای طولانی را به شدت کاهش دهد.
چرا مدلهای دیفیوژن پیوسته در ریاضی و کدنویسی موفقتر از دیفیوژنهای گسسته قبلی هستند؟
زیرا فضای برداری پیوسته به الگوریتمهای هدایت متن اجازه میدهد تا با استفاده از معادلات دیفرانسیل، مسیر استدلال را به شکلی نرم و دقیق به سمت پاسخهای منطقیتر هدایت کنند.