شرکت انویدیا (NVIDIA) در ۱۶ سپتامبر ۲۰۲۶ نتایج نخستین ارسال پیشنمایش سامانهٔ Vera Rubin NVL72 را در مجموعهٔ بنچمارک MLPerf Inference نسخهٔ ۶٫۱ منتشر کرد. بر اساس اعلام رسمی وبلاگ انویدیا، این سامانه در مقایسه با GB300 NVL72 تا ۳٫۷ برابر توان عملیاتی (throughput) بالاتر ثبت کرده است. نتایج از پایگاه MLCommons در همان روز بازیابی شده و به شناسههای ارسال ۶٫۱-۰۱۰۶ و ۶٫۱-۰۰۷۴ ارجاع داده شده است.
در همین گزارش آمده که مقیاسپذیری کارآمد و بهینهسازی پیوستهٔ نرمافزار در کنار عملکرد سختافزاری، سه اهرم اصلی اقتصاد استنتاج هوش مصنوعی بهشمار میروند؛ چون توان بالاتر یعنی تولید توکن بیشتر و مقیاس خطیتر یعنی نیاز کمتر به منابع برای خدمترسانی در مقیاس بزرگ.
Vera Rubin NVL72 در MLPerf Inference ۶٫۱
انویدیا نتایج پیشنمایش Vera Rubin NVL72 را روی دو بنچمارک پرتقاضای این مجموعه، یعنی DeepSeek-R1 و Qwen3-VL، ارسال کرده است. طبق گزارش، روی Qwen3-VL و با استفاده از vLLM همراه با چارچوب متنباز استنتاج NVIDIA Dynamo، توان عملیاتی در سناریوهای آفلاین، سرور و تعاملی تا ۳٫۷ برابر GB300 NVL72 بوده است. روی DeepSeek-R1 و با کتابخانهٔ TensorRT-LLM این رقم تا ۲٫۵ برابر اعلام شده است.
شرکت میگوید این ارقام اولیه نشاندهندهٔ سرعت نوآوری و ادامهٔ بهبود عملکرد با بهینهسازیهای نرمافزاری است. همچنین نبیوس (Nebius) نیز نتایج پیشنمایش Vera Rubin NVL72 را ارسال کرده و عملکرد مناسبی نشان داده است.
جزئیات فنی اعلامشده برای عملکرد بالاتر
طبق متن رسمی، عملکرد گزارششده حاصل همطراحی سختافزار و نرمافزار است. هستههای تنسور و موتور ترانسفورمر تقویتشدهٔ Vera Rubin هم مرحلهٔ prefill و هم decode را شتاب میدهند و دقت NVFP4 حجم حافظه را در وزن مدل، توجه و کش KV کاهش میدهد تا توان افزایش یابد و افت کیفیت خروجی به حداقل برسد.
ارسالهای Vera Rubin بهطور گسترده از سروینگ جداسازیشده (disaggregated serving) برای جدا کردن prefill و decode و همچنین موازیسازی در مقیاس بزرگ برای لایههای mixture-of-experts مدلهایی مانند DeepSeek-R1 و Qwen3-VL بهره بردهاند. دامنهٔ scale-up در NVL72 با نسل ششم NVLink و NVLink Switch پشتیبانی میشود که انویدیا آن را ۱۰ برابر نرخ بستهٔ بالاتر و ۳ برابر تأخیر کمتر نسبت به اترنت معمولی توصیف کرده است.
مقیاسپذیری GB300 و بهینهسازی نرمافزار
در بخش مقیاس، ارسال DeepSeek-R1 انویدیا از یک رک GB300 NVL72 با ۷۲ پردازندهٔ گرافیکی تا چهار رک با ۲۸۸ پردازندهٔ گرافیکی گسترش یافته و در سناریوی آفلاین به بازده مقیاسپذیری ۹۹ درصد رسیده است؛ یعنی توان تقریباً متناسب با افزودن سختافزار رشد کرده است.
همچنین روی بنچمارک متنبهویدئوی WAN ۲٫۲، سامانهٔ GB300 NVL72 به ۰٫۶۵ ویدئوی ۷۲۰p در ثانیه با میانگین ۵٫۷ ثانیه بهازای هر ویدئو رسیده است که انویدیا آن را ۹ برابر توان بالاتر و ۷٫۵ برابر تأخیر کمتر نسبت به یک گرهٔ منفرد اعلام کرده است.
از سوی نرمافزار، عملکرد GB300 NVL72 روی Qwen3-VL در نسخهٔ ۶٫۱ تا ۱٫۶ برابر نسبت به نتایج نسخهٔ ۶٫۰ بهبود یافته است. عوامل ذکرشده شامل دقت پایینتر کش KV، ادغام کرنل بیشتر، کرنلهای بهتر و سروینگ جداسازیشده با vLLM و Dynamo هستند. انویدیا میگوید بهینهسازی حتی پس از مهلت ارسال ۶٫۱ نیز روی مدلهایی مانند GPT-OSS-120B و DLRMv3 ادامه یافته، هرچند این ارقام پس از ارسال هنوز توسط MLCommons تأیید نشدهاند.
ایجنتها، لبه و اکوسیستم شرکا
گزارش تأکید میکند که ایجنتهای هوش مصنوعی که استدلال، برنامهریزی و اقدام چندمرحلهای انجام میدهند، شیوهٔ سنجش عملکرد استنتاج را تغییر میدهند. در آزمونهای پیشنمایشی مانند SemiAnalysis AgentX، Vera Rubin NVL72 تا ۳۰ برابر عملکرد بهتر نسبت به GB300 NVL72 ثبت کرده است. همچنین بنچمارک آیندهٔ MLPerf Endpoints برای استانداردسازی سنجش بارهای ایجنتیک معرفی شده است.
فراتر از پلتفرم Grace Blackwell و Vera Rubin، انویدیا نتایج Jetson AGX Thor را با TensorRT Edge-LLM روی بنچمارک تازهمعرفیشدهٔ Edge-Agentic با مدل Qwen3.6-27B نیز ارسال کرده است. در اکوسیستم شرکا ۱۹ شریک مشارکت داشتهاند که هشت مورد روی سامانههای چندگرهی Blackwell NVL72 بودهاند؛ از جمله ASUS، Azure، Cisco، CoreWeave، Crusoe، Dell، Fujitsu، HPE، Lambda، Nebius، Oracle Cloud و چند شرکت دیگر.
منبع: وبلاگ انویدیا — NVIDIA Vera Rubin NVL72 Delivers Leading Performance in MLPerf Inference v6.1 Debut.