CUDA Toolkit ۱۳٫۴ طبق اعلام رسمی انویدیا در ۹ سپتامبر ۲۰۲۶، پشتیبانی از توسعهٔ برنامه‌های CUDA روی ویندوز مبتنی بر معماری آرم را اضافه کرده است. پیش از این، پشتیبانی CUDA روی پلتفرم‌های آرم عمدتاً از مسیر لینوکس فراهم بود؛ این انتشار همان قابلیت را به Windows on Arm گسترش می‌دهد. افزون بر آن، پیش‌نمایش معماری گرافیکی روبین، لایهٔ کنترل تازه‌ای برای Multi-Process Service، گسترش CUDA Python و CCCL، و به‌روزرسانی ابزارهای Nsight در این نسخه آمده است.

پشتیبانی از ویندوز روی آرم

بنا بر گزارش فنی NVIDIA Developer Blog، نسخهٔ ۱۳٫۴ امکان توسعهٔ اپلیکیشن‌های CUDA را روی Windows on Arm فراهم می‌کند. کتابخانه‌های ریاضی هسته‌ای این نسخه نیز برای اکوسیستم لپ‌تاپ مبتنی بر N1X پشتیبانی کارکردی Windows on Arm را اعلام کرده‌اند. این تغییر برای توسعه‌دهندگان ویندوز روی سخت‌افزار آرم مسیر رسمی‌تری برای کامپایل، اشکال‌زدایی و اجرای بارهای CUDA می‌گشاید.

Nsight Systems نسخهٔ ۲۰۲۶٫۵٫۱ نیز پوشش پلتفرم را گسترش داده و پشتیبانی از CUDA ۱۳٫۴، GPUهای روبین و Windows on Arm را ذکر کرده است. به این ترتیب، علاوه بر خود Toolkit، زنجیرهٔ پروفایل‌گیری هم با همان پلتفرم هماهنگ شده است.

پیش‌نمایش روبین و مدیریت GPU اشتراکی

نسخهٔ ۱۳٫۴ پشتیبانی کارکردی از معماری روبین را با قابلیت محاسبهٔ ۱۰۷ (compute capability 107) به‌صورت پیش‌نمایش اضافه کرده تا توسعه‌دهندگان پیش از دسترسی عمومی کامل، انتقال برنامه‌ها را آغاز کنند. در بخش کامپایلر، هدف معماری SM_107 برای روبین و سازگاری میزبان با GCC ۱۶ و Clang ۲۲ در پلتفرم‌های پشتیبانی‌شده ذکر شده است.

MPS V3 لایهٔ کنترل مدرن‌تری برای اشتراک GPU معرفی می‌کند: رابط خط فرمان قابل‌اسکریپت، نمونه‌های نام‌دار سرور، فضای نام برای سازمان‌دهی بارهای همزمان، پیکربندی TOML، کنترل پارتیشن SM و محدودیت حافظهٔ GPU یکپارچه با cgroup. هدف اعلام‌شده، پارتیشن‌بندی دقیق‌تر GPU در محیط‌های کانتینری همراه با جداسازی منابع است.

قابلیت CUDA Compute Fabric Transport نیز برای توسعه‌دهندگان کتابخانه‌های ارتباطی سطح پایین معرفی شده تا داده را روی پارچهٔ NVLink با نقاط پایانی منطقی نام‌دار و عملیات ناهمگام put/get/reduction جابه‌جا کنند؛ انویدیا تأکید کرده بیشتر برنامه‌نویسان کاربردی بهتر است همچنان از کتابخانه‌هایی مثل NCCL یا NVSHMEM استفاده کنند.

CUDA Python، CCCL و ابزارهای توسعه‌دهنده

در بخش پایتون، cuda.core نسخهٔ ۱٫۱٫۰ برنامه‌نویسی texture و surface، حافظهٔ مدیریت‌شدهٔ آگاه از NUMA و فایل‌های type stub با پسوند pyi را گسترش داده است. cuda.compute ۱٫۱ امکان کامپایل پیشاپیش الگوریتم‌های CCCL برای چند معماری GPU — حتی روی سامانه‌های بدون GPU — را فراهم می‌کند. CCCL ۳٫۴ نیز پیاده‌سازی warp-specialized تازه‌ای از cub::DeviceScan روی Blackwell اعلام کرده که در بنچمارک‌های گزارش‌شده تا حدود ۹۲٪ بهره‌وری از پهنای باند حافظه رسیده است.

از دیگر نکات اعلام‌شده می‌توان به جداشدن نصب درایور از بسته‌های Toolkit در نصب‌کننده‌های SDK، پیش‌فرض‌شدن Coherent Driver-based Memory Management روی پلتفرم‌های همدوس مثل Grace Hopper و Grace Blackwell، و به‌روزرسانی‌های Nsight Compute، Nsight Python ۱٫۰، Compute Sanitizer و کتابخانه‌های ریاضی هسته‌ای اشاره کرد. برای جزئیات سازگاری، انویدیا به یادداشت انتشار CUDA Toolkit ۱۳٫۴ ارجاع داده است.

آیا گسترش رسمی CUDA به ویندوز روی آرم، مسیر توسعهٔ نرم‌افزار GPU روی لپ‌تاپ‌های مبتنی بر SoC آرم را تغییر می‌دهد؟