انویدیا با ثبت رکوردهای خیرهکننده در بنچمارک معتبر MLPerf Inference v6.1، قدرت معماری نسل بعد خود موسوم به Vera Rubin را به رخ رقبا کشید. سیستم پردازشی Vera Rubin NVL72 در نخستین نمایش رسمی خود توانسته تا ۳.۷ برابر بازدهی پردازشی بالاتری نسبت به پرچمدار نسل پیشین (GB300 NVL72) ثبت کند.
شاهکار تازه انویدیا؛ جهش نسلی شگفتانگیز در استنتاج هوش مصنوعی
در دنیای پردازش هوش مصنوعی، بخش استنتاج (Inference) یا همان اجرای زنده مدلها، بیشترین سهم از هزینههای ابری و مصرف انرژی را تشکیل میدهد. انویدیا با معرفی اولیه سیستم Vera Rubin NVL72 نشان داد که نهتنها به دنبال حفظ جایگاه رهبری خود در این بازار است، بلکه میخواهد فاصله فنی خود با رقبا را به سطحی دستنیافتنی برساند. در تازهترین ارزیابیهای ائتلاف MLCommons برای آزمون MLPerf Inference نسخه ۶.۱، سیستم روبین توانسته عملکردی فراتر از انتظارات تحلیلگران ارائه دهد.
درخشش در سنگینترین بنچمارکهای هوش مصنوعی: DeepSeek و Qwen
انویدیا سیستم جدید خود را در دو نمونه از پیچیدهترین و مدرنترین مدلهای هوش مصنوعی منبعباز یعنی DeepSeek-R1 و Qwen3-VL محک زده است:
- مدل بینایی-زبانی Qwen3-VL: سیستم Vera Rubin NVL72 با بهرهگیری از فریمورکهای بهینهسازی vLLM و Dynamo توانسته در سناریوهای مختلف تا ۳.۷ برابر خروجی (Throughput) بیشتر نسبت به سیستم GB300 ثبت کند.
- مدل استدلالی DeepSeek-R1: با تکیه بر کتابخانه بهینهسازی TensorRT-LLM، نرخ پردازش این مدل استدلالی سنگین تا ۲.۵ برابر سریعتر از بهترین رکورد سیستمهای GB300 انجام شده است.
این ارقام بدین معناست که شرکتهای ارائهدهنده خدمات ابری با خرید هر رک پردازشی روبین میتوانند حجم بهمراتب بیشتری از توکنها را تولید کرده و هزینه نهایی پردازش هر توکن را به شکلی چشمگیر کاهش دهند.
جهش باورنکردنی ۳۰ برابری در پردازش عاملهای هوشمند (AI Agents)
با تغییر جهت کاربردهای هوش مصنوعی به سمت عاملهای خودمختار (Agents) که نیازمند برنامهریزی چندمرحلهای و تصمیمگیری زنجیرهای هستند، سنجههای ارزیابی نیز دستخوش تغییر شدهاند. در بنچمارک اختصاصی SemiAnalysis AgentX که برای ارزیابی رفتارهای استدلالی عاملها طراحی شده، سیستم Vera Rubin NVL72 موفق شده رکوردی حیرتانگیز تا ۳۰ برابر سریعتر از نسل GB300 به ثبت برساند.
رمز موفقیت روبین؛ همافزایی بینظیر سختافزار و نرمافزار
رسیدن به چنین پرش نسلی بزرگی تنها ناشی از افزایش تعداد ترانزیستورها نیست، بلکه حاصل طراحی یکپارچه تمام لایههای فناوری است:
- فناوری پردازش با دقت NVFP4: استفاده از فرمت فشرده و کارآمد NVFP4 باعث کاهش محسوس حافظه مورد نیاز برای ذخیره وزنهای مدل و بافر KV Cache شده که خروجی را بدون افت کیفیت پاسخها افزایش میدهد.
- سرویسدهی تفکیکشده (Disaggregated Serving): تفکیک فاز پیشپردازش (Prefill) و رمزگشایی (Decode) در کنار موازیسازی تخصصی برای معماری مدلهای ترکیبی از خبرگان (MoE).
- نسل ششم رابط اتصالی NVLink: دستیابی به نرخ انتقال داده تا ۱۰ برابر سریعتر و تأخیر ۳ برابری کمتر در مقایسه با استانداردهای شبکه اترنت صنعتی، برقراری ارتباط سریع میان ۷۲ تراشه موجود در رک را تضمین میکند.

جدول مقایسه دستاوردهای سیستمهای محاسباتی انویدیا
| شاخص ارزیابی | سیستم پیشین (GB300 NVL72) | سیستم جدید (Vera Rubin NVL72) | میزان بهبود و جهش |
|---|---|---|---|
| نرخ پردازش مدل Qwen3-VL | مبنای استاندارد نسل پیشین | افزایش چشمگیر توکن در ثانیه | تا ۳.۷ برابر سریعتر |
| نرخ استنتاج مدل DeepSeek-R1 | مبنای استاندارد نسل پیشین | پردازش همزمان با فریمورک بهینه | تا ۲.۵ برابر سریعتر |
| عملکرد در بنچمارک AgentX | سطح عادی محاسبات استدلالی | معماری بهینهشده برای پردازش عاملها | تا ۳۰ برابر بهبود پردازشی |
| فناوری ارتباطی رک | نسل پنجم NVLink | نسل ششم NVLink با سوئیچ پیشرفته | ۱۰ برابر نرخ پکت بالاتر |
تاثیر ورود Vera Rubin بر اقتصاد زیرساختهای ابری
ورود معماری روبین پیامی روشن برای غولهای ابری نظیر مایکروسافت، گوگل و آمازون دارد: بهرهوری اقتصادی استنتاج هوش مصنوعی در حال بازتعریف است. از سویی، انویدیا اعلام کرده که علاوه بر سختافزار جدید، بهینهسازیهای نرمافزاری صرف در مقایسه با نگارش ۶.۰ بنچمارک MLPerf تا ۱.۶ برابر کارایی سیستمهای فعلی را افزایش داده است. این یعنی خریداران سختافزارهای انویدیا حتی پس از خرید نیز شاهد رشد توان پردازشی به واسطه ارتقای درایورها و فریمورکها خواهند بود.
جمعبندی
نتایج اولیه MLPerf Inference v6.1 ثابت میکند که معماری Vera Rubin انویدیا یک گام بلند رو به جلو در کاهش هزینهها و افزایش سرعت استنتاج هوش مصنوعی است. جهش ۳.۷ برابری در پردازش مدلهای پیچیده و برتری خیرهکننده در حوزه عاملهای هوشمند، سلطه انویدیا را بر بازار سختافزارهای دیتاسنتر بیش از پیش مستحکم میکند.
سؤالات متداول
سیستم Vera Rubin NVL72 تا چه میزان نسبت به نسل قبل سریعتر است؟
در بنچمارکهای رسمی MLPerf v6.1، این سیستم تا ۳.۷ برابر در پردازش مدل Qwen3-VL، تا ۲.۵ برابر در مدل DeepSeek-R1 و تا ۳۰ برابر در پردازش عاملهای هوشمند نسبت به GB300 NVL72 سریعتر عمل کرده است.
مهمترین تغییرات معماری در سیستم جدید ورا روبین چیست؟
بهرهگیری از فرمت کممصرف NVFP4، موتور ترنسفورمر ارتقایافته، تفکیک فازهای پردازشی Prefill و Decode و نسل ششم اتصال فوق سریع NVLink از مهمترین نوآوریهای آن هستند.
بنچمارک MLPerf چیست و چرا اهمیت دارد؟
یک بنچمارک استاندارد و مورد تایید صنعت تکنولوژی است که توسط ائتلاف MLCommons برگزار میشود و عملکرد واقعی تراشهها را در سناریوهای آموزش و استنتاج هوش مصنوعی بدون بزرگنمایی تبلیغاتی میسنجد.
تأثیر این پردازنده جدید بر هزینههای هوش مصنوعی چیست؟
افزایش شدید نرخ تولید توکن در هر رک سختافزاری، باعث کاهش چشمگیر مصرف انرژی و هزینه تمامشده پردازش به ازای هر کاربر برای سرویسهای ابری هوش مصنوعی میشود.

