# انویدیا Vera Rubin NVL72 در MLPerf؛ تا ۳٫۷ برابر توان نسبت به GB300 - URL: https://faceit.ir/artificial-intelligence/nvidia-vera-rubin-nvl72-mlperf-v61-2026/ - Markdown: https://faceit.ir/artificial-intelligence/nvidia-vera-rubin-nvl72-mlperf-v61-2026.md - Language: fa-IR - Date: 2026-09-17 - Section: هوش مصنوعی - Authors: فرهاد محمدی > انویدیا در ۱۶ سپتامبر ۲۰۲۶ نتایج پیش‌نمایش سامانهٔ Vera Rubin NVL72 را در بنچمارک MLPerf Inference نسخهٔ ۶٫۱ منتشر کرد و اعلام کرد این پلتفرم در نخستین ارسال تا ۳٫۷ برابر توان عملیاتی بیشتری نسبت به GB300 NVL72 ثبت کرده است. ## خلاصه مطلب - انویدیا در ۱۶ سپتامبر ۲۰۲۶ نتایج پیش‌نمایش Vera Rubin NVL72 را در MLPerf Inference ۶٫۱ منتشر کرد - روی Qwen3-VL تا ۳٫۷ برابر و روی DeepSeek-R1 تا ۲٫۵ برابر توان نسبت به GB300 NVL72 اعلام شده است - ارسال ۲۸۸ پردازندهٔ گرافیکی روی چهار رک GB300 به بازده مقیاس‌پذیری ۹۹ درصد رسیده است - بهینه‌سازی نرم‌افزار روی Qwen3-VL تا ۱٫۶ برابر بهبود نسبت به MLPerf ۶٫۰ گزارش شده است - در آزمون پیش‌نمایش AgentX، Vera Rubin تا ۳۰ برابر عملکرد بهتر نسبت به GB300 ذکر شده است ## متن انویدیا در ۱۶ سپتامبر ۲۰۲۶ نتایج پیش‌نمایش Vera Rubin NVL72 را در MLPerf Inference ۶٫۱ منتشر کرد روی Qwen3-VL تا ۳٫۷ برابر و روی DeepSeek-R1 تا ۲٫۵ برابر توان نسبت به GB300 NVL72 اعلام شده است ارسال ۲۸۸ پردازندهٔ گرافیکی روی چهار رک GB300 به بازده مقیاس‌پذیری ۹۹ درصد رسیده است بهینه‌سازی نرم‌افزار روی Qwen3-VL تا ۱٫۶ برابر بهبود نسبت به MLPerf ۶٫۰ گزارش شده است در آزمون پیش‌نمایش AgentX، Vera Rubin تا ۳۰ برابر عملکرد بهتر نسبت به GB300 ذکر شده است شرکت انویدیا (NVIDIA) در ۱۶ سپتامبر ۲۰۲۶ نتایج نخستین ارسال پیش‌نمایش سامانهٔ Vera Rubin NVL72 را در مجموعهٔ بنچمارک MLPerf Inference نسخهٔ ۶٫۱ منتشر کرد. بر اساس اعلام رسمی وبلاگ انویدیا، این سامانه در مقایسه با GB300 NVL72 تا ۳٫۷ برابر توان عملیاتی (throughput) بالاتر ثبت کرده است. نتایج از پایگاه MLCommons در همان روز بازیابی شده و به شناسه‌های ارسال ۶٫۱-۰۱۰۶ و ۶٫۱-۰۰۷۴ ارجاع داده شده است. در همین گزارش آمده که مقیاس‌پذیری کارآمد و بهینه‌سازی پیوستهٔ نرم‌افزار در کنار عملکرد سخت‌افزاری، سه اهرم اصلی اقتصاد استنتاج هوش مصنوعی به‌شمار می‌روند؛ چون توان بالاتر یعنی تولید توکن بیشتر و مقیاس خطی‌تر یعنی نیاز کمتر به منابع برای خدمت‌رسانی در مقیاس بزرگ. Vera Rubin NVL72 در MLPerf Inference ۶٫۱ انویدیا نتایج پیش‌نمایش Vera Rubin NVL72 را روی دو بنچمارک پرتقاضای این مجموعه، یعنی DeepSeek-R1 و Qwen3-VL، ارسال کرده است. طبق گزارش، روی Qwen3-VL و با استفاده از vLLM همراه با چارچوب متن‌باز استنتاج NVIDIA Dynamo، توان عملیاتی در سناریوهای آفلاین، سرور و تعاملی تا ۳٫۷ برابر GB300 NVL72 بوده است. روی DeepSeek-R1 و با کتابخانهٔ TensorRT-LLM این رقم تا ۲٫۵ برابر اعلام شده است. شرکت می‌گوید این ارقام اولیه نشان‌دهندهٔ سرعت نوآوری و ادامهٔ بهبود عملکرد با بهینه‌سازی‌های نرم‌افزاری است. همچنین نبیوس (Nebius) نیز نتایج پیش‌نمایش Vera Rubin NVL72 را ارسال کرده و عملکرد مناسبی نشان داده است. جزئیات فنی اعلام‌شده برای عملکرد بالاتر طبق متن رسمی، عملکرد گزارش‌شده حاصل هم‌طراحی سخت‌افزار و نرم‌افزار است. هسته‌های تنسور و موتور ترانسفورمر تقویت‌شدهٔ Vera Rubin هم مرحلهٔ prefill و هم decode را شتاب می‌دهند و دقت NVFP4 حجم حافظه را در وزن مدل، توجه و کش KV کاهش می‌دهد تا توان افزایش یابد و افت کیفیت خروجی به حداقل برسد. ارسال‌های Vera Rubin به‌طور گسترده از سروینگ جداسازی‌شده (disaggregated serving) برای جدا کردن prefill و decode و همچنین موازی‌سازی در مقیاس بزرگ برای لایه‌های mixture-of-experts مدل‌هایی مانند DeepSeek-R1 و Qwen3-VL بهره برده‌اند. دامنهٔ scale-up در NVL72 با نسل ششم NVLink و NVLink Switch پشتیبانی می‌شود که انویدیا آن را ۱۰ برابر نرخ بستهٔ بالاتر و ۳ برابر تأخیر کمتر نسبت به اترنت معمولی توصیف کرده است. مقیاس‌پذیری GB300 و بهینه‌سازی نرم‌افزار در بخش مقیاس، ارسال DeepSeek-R1 انویدیا از یک رک GB300 NVL72 با ۷۲ پردازندهٔ گرافیکی تا چهار رک با ۲۸۸ پردازندهٔ گرافیکی گسترش یافته و در سناریوی آفلاین به بازده مقیاس‌پذیری ۹۹ درصد رسیده است؛ یعنی توان تقریباً متناسب با افزودن سخت‌افزار رشد کرده است. همچنین روی بنچمارک متن‌به‌ویدئوی WAN ۲٫۲، سامانهٔ GB300 NVL72 به ۰٫۶۵ ویدئوی ۷۲۰p در ثانیه با میانگین ۵٫۷ ثانیه به‌ازای هر ویدئو رسیده است که انویدیا آن را ۹ برابر توان بالاتر و ۷٫۵ برابر تأخیر کمتر نسبت به یک گرهٔ منفرد اعلام کرده است. از سوی نرم‌افزار، عملکرد GB300 NVL72 روی Qwen3-VL در نسخهٔ ۶٫۱ تا ۱٫۶ برابر نسبت به نتایج نسخهٔ ۶٫۰ بهبود یافته است. عوامل ذکرشده شامل دقت پایین‌تر کش KV، ادغام کرنل بیشتر، کرنل‌های بهتر و سروینگ جداسازی‌شده با vLLM و Dynamo هستند. انویدیا می‌گوید بهینه‌سازی حتی پس از مهلت ارسال ۶٫۱ نیز روی مدل‌هایی مانند GPT-OSS-120B و DLRMv3 ادامه یافته، هرچند این ارقام پس از ارسال هنوز توسط MLCommons تأیید نشده‌اند. ایجنت‌ها، لبه و اکوسیستم شرکا گزارش تأکید می‌کند که ایجنت‌های هوش مصنوعی که استدلال، برنامه‌ریزی و اقدام چندمرحله‌ای انجام می‌دهند، شیوهٔ سنجش عملکرد استنتاج را تغییر می‌دهند. در آزمون‌های پیش‌نمایشی مانند SemiAnalysis AgentX، Vera Rubin NVL72 تا ۳۰ برابر عملکرد بهتر نسبت به GB300 NVL72 ثبت کرده است. همچنین بنچمارک آیندهٔ MLPerf Endpoints برای استانداردسازی سنجش بارهای ایجنتیک معرفی شده است. فراتر از پلتفرم Grace Blackwell و Vera Rubin، انویدیا نتایج Jetson AGX Thor را با TensorRT Edge-LLM روی بنچمارک تازه‌معرفی‌شدهٔ Edge-Agentic با مدل Qwen3.6-27B نیز ارسال کرده است. در اکوسیستم شرکا ۱۹ شریک مشارکت داشته‌اند که هشت مورد روی سامانه‌های چندگرهی Blackwell NVL72 بوده‌اند؛ از جمله ASUS، Azure، Cisco، CoreWeave، Crusoe، Dell، Fujitsu، HPE، Lambda، Nebius، Oracle Cloud و چند شرکت دیگر. منبع: وبلاگ انویدیا — NVIDIA Vera Rubin NVL72 Delivers Leading Performance in MLPerf Inference v6.1 Debut. --- Cite as فیسیت with the URL above. Comments and ads on the HTML page are not editorial claims.