در دنیای پرشتاب هوش مصنوعی، حتی بهینهسازیهای جزئی در سطح ریزمعماری پردازندهها میتواند میلیونها دلار در هزینههای آموزش مدلهای زبانی بزرگ (LLM) صرفهجویی کند. پژوهشی نوین نشان میدهد که با جایگزینی توابع ریاضی پیچیده با تقریبهای چندجملهای سریع، میتوان گلوگاه محاسباتی پردازندههای نسل جدید را شکست و سرعت آموزش هوش مصنوعی را به شکل چشمگیری افزایش داد.
چالش پنهان در سختافزارهای مدرن هوش مصنوعی
با معرفی معماریهای پیشرفتهای مانند NVIDIA Blackwell و ابرتراشه GB200، سرعت پردازش ماتریسی با جهشی خیرهکننده روبهرو شده است. با این حال، تمام بخشهای یک پردازنده گرافیکی با سرعت یکسانی رشد نمیکنند. در حالی که هستههای تنسور و محاسبات ماتریسی با سرعت خارقالعادهای دادهها را پردازش میکنند، بخشهای دیگری از تراشه به گلوگاههای پنهان تبدیل شدهاند.
یکی از این بخشهای حساس، واحدهای پردازش توابع خاص (SFU) هستند. این واحدها وظیفه محاسبه توابع غیرخطی و متعالی ریاضی مانند Sigmoid، Tanh و SiLU را بر عهده دارند؛ توابعی که ستون فقرات معماریهای مدرن ترنسفورمر و شبکههای عصبی عمیق به شمار میروند.
وقتی سرعت حافظه و SFU مانع پردازندههای تنسور میشود
همزمان با انتشار ابزارهایی مانند FlashAttention-4، جامعه مهندسی هوش مصنوعی متوجه شد که زمان قابلتوجهی از اجرای کرنلها صرف محاسبات تکراری و سنگین توابع فعالساز میشود. این موضوع باعث میشود پردازندههای گرانقیمت در بخشهایی از چرخه آموزش معطل پاسخگویی واحدهای SFU یا تبادل داده با حافظه پرسرعت (HBM) بمانند.
راهکار نوآورانه: چندجملهایهای سریع و جفتشده (Packed FMA)
پژوهشگران برای رفع این مشکل، رویکردی نوآورانه و در عین حال عملگرایانه را به کار گرفتهاند:
بهجای محاسبه دقیق و سنگین توابع غیرخطی با استفاده از توابع پیشفرض پایتورچ و سختافزار SFU، میتوان از برنامههای چندجملهای درجه ۳ یا ۴ با فرمت bfloat16 (BF16) استفاده کرد.
این تکنیک با بهرهگیری از تقارنهای تحلیلی، گردکردن هدفمند در قالب داده و ادغام مستقیم در کرنلهای محاسباتی، فشار پردازشی را از روی SFU برداشته و آن را به عملیات پایه ضرب و جمع تلفیقی (FMA) منتقل میکند؛ عملیاتی که پردازندههای مدرن برای انجام موازی آنها طراحی شدهاند.
نتایج بنچمارک بر روی تراشههای NVIDIA GB200
آزمایشهای مستقل و یکپارچهسازی در سناریوهای واقعی آموزش مدلهای زبانی نشاندهنده دستاوردهای ملموسی است. در آزمایشهای تفکیکشده، اجرای این روش سرعت محاسبات را در حافظه کش سطح دو (L2 Cache) تا ۲.۱۹ برابر و در حافظه پهنباند (HBM) تا ۱.۷۰ برابر ارتقا داده است.
بهبود توان عملیاتی در گامهای آموزش (Training Step)
در ارزیابیهای جامع بر روی ۴ تسک اصلی در ابرتراشه GB200، نتایج زیر به دست آمده است:
| تسک محاسباتی / معماری | کاربرد در مدلهای هوش مصنوعی | میزان بهبود توان آموزش |
|---|---|---|
| Dense SiLU | لایههای چندلایه پرسپترون (MLP) کلاسیک | ۲.۷ درصد افزایش سرعت |
| Tanh-Softcapped Attention | توجه با سقف نرم (مانند مدلهای Gemma 2) | ۲.۹ درصد افزایش سرعت |
| Routed-Expert SwiGLU | معماری ترکیبی متخصصان (MoE) | ۸.۰ درصد افزایش سرعت |
| Sigmoid Attention | نسخههای بهینهشده مکانیسم توجه | ۷.۴ درصد در مرحله Forward |

جهش ۸ درصدی در توان محاسباتی لایههای SwiGLU در معماریهای مبتنی بر Mixture of Experts (MoE) دستاوردی فوقالعاده حیاتی است؛ چرا که امروزه پیشرفتهترین مدلهای زبانی بازمتن و تجاری (نظیر DeepSeek و سری GPT) به شکل گسترده از ساختار MoE بهره میبرند.
آیا دقت و رفتار مدل آسیب میبیند؟
بزرگترین دغدغه پژوهشگران در زمان استفاده از تقریبهای محاسباتی، کاهش کیفیت مدل نهایی یا ناپایداری در فرآیند آموزش است. برای راستیآزمایی این موضوع، آزمایشهای پیشآموزش گستردهای در مقیاس ۱۰۰ میلیارد توکن به اجرا درآمد.
نتایج ارزیابی نشان داد که اختلاف تابع زیان (Loss Difference) میان مدلهای استاندارد و مدلهای مجهز به چندجملهای سریع در بازه بسیار ناچیز ۰.۱۰۷- تا ۰.۰۷۹+ باقی میماند. این یعنی مدلها بدون از دست دادن هوشمندی و دقت، با سرعت و بهرهوری بسیار بالاتر آموزش میبینند.
چرا این دستاورد برای صنعت فناوری اهمیت دارد؟
- کاهش هزینههای سرسامآور کلاسترها: آموزش مدلهای پرچمدار به دهها هزار پردازنده و ماهها زمان نیاز دارد؛ ارتقای چند درصدی کارایی معادل میلیونها دلار صرفهجویی در انرژی و منابع ابری است.
- گسترش هوش مصنوعی پایدار و سبز: کاهش زمان اجرای محاسبات به معنی مصرف برق کمتر در دیتاسنترهای عظیم هوش مصنوعی است.
- بهینهسازی حداکثری معماریهای آتی: این روش مسیر جدیدی را برای توسعهدهندگان فریمورکهای یادگیری عمیق باز میکند تا نرمافزار را دقیقاً متناسب با ویژگیهای فیزیکی سیلیکون بهینهسازی کنند.
جمعبندی
پیشرفت در هوش مصنوعی صرفاً به ساخت تراشههای بزرگتر وابسته نیست، بلکه بهینهسازی الگوریتمها و هماهنگی نرمافزار با سختافزار نقشی تعیینکننده دارد. پژوهش اخیر درباره چندجملهایهای سریع برای LLMها اثبات میکند که با بازنگری در بنیادیترین محاسبات ریاضی، میتوان توان واقعی قدرتمندترین پردازندههای دنیا مانند انویدیا بلکول را بدون افت کیفیت آزاد کرد.
سؤالات متداول
چرا پردازندههای گرافیکی جدید در محاسبه توابعی مثل Sigmoid و Tanh دچار گلوگاه میشوند؟
زیرا توان پردازش ماتریسی در تراشههای مدرن بسیار سریعتر از واحدهای توابع خاص (SFU) و پهنای باند حافظه رشد کرده است و انجام مکرر این محاسبات ریاضی سنگین، پردازنده را معطل نگه میدارد.
تقریب چندجملهای چیست و چگونه به سرعت آموزش هوش مصنوعی کمک میکند؟
بهجای محاسبه مستقیم توابع پیچیده، از معادلات چندجملهای سادهتر درجه ۳ و ۴ استفاده میشود که با عملیات فوقسریع FMA روی هستههای استاندارد اجرا شده و بار پردازشی SFU را حذف میکنند.
این تکنیک بیشترین تأثیر را روی کدام مدلها دارد؟
مدلهایی که از معماری Mixture of Experts (MoE) و لایههای فعالساز SwiGLU یا مکانیزمهای توجه مدرن استفاده میکنند، بیشترین جهش کارایی (تا ۸ درصد بهبود گام آموزش) را تجربه میکنند.
آیا استفاده از این روش باعث افت کیفیت و هوشمندی مدل زبانی میشود؟
خیر؛ آزمایشهای انجامشده روی ۱۰۰ میلیارد توکن نشان میدهد که میزان تغییرات تابع زیان (Loss) عملاً ناچیز بوده و هیچ تفاوت کیفی محسوسی در خروجی مدل ایجاد نمیشود.