CUDA Toolkit ۱۳٫۴ طبق اعلام رسمی انویدیا در ۹ سپتامبر ۲۰۲۶، پشتیبانی از توسعهٔ برنامههای CUDA روی ویندوز مبتنی بر معماری آرم را اضافه کرده است. پیش از این، پشتیبانی CUDA روی پلتفرمهای آرم عمدتاً از مسیر لینوکس فراهم بود؛ این انتشار همان قابلیت را به Windows on Arm گسترش میدهد. افزون بر آن، پیشنمایش معماری گرافیکی روبین، لایهٔ کنترل تازهای برای Multi-Process Service، گسترش CUDA Python و CCCL، و بهروزرسانی ابزارهای Nsight در این نسخه آمده است.
پشتیبانی از ویندوز روی آرم
بنا بر گزارش فنی NVIDIA Developer Blog، نسخهٔ ۱۳٫۴ امکان توسعهٔ اپلیکیشنهای CUDA را روی Windows on Arm فراهم میکند. کتابخانههای ریاضی هستهای این نسخه نیز برای اکوسیستم لپتاپ مبتنی بر N1X پشتیبانی کارکردی Windows on Arm را اعلام کردهاند. این تغییر برای توسعهدهندگان ویندوز روی سختافزار آرم مسیر رسمیتری برای کامپایل، اشکالزدایی و اجرای بارهای CUDA میگشاید.
Nsight Systems نسخهٔ ۲۰۲۶٫۵٫۱ نیز پوشش پلتفرم را گسترش داده و پشتیبانی از CUDA ۱۳٫۴، GPUهای روبین و Windows on Arm را ذکر کرده است. به این ترتیب، علاوه بر خود Toolkit، زنجیرهٔ پروفایلگیری هم با همان پلتفرم هماهنگ شده است.
پیشنمایش روبین و مدیریت GPU اشتراکی
نسخهٔ ۱۳٫۴ پشتیبانی کارکردی از معماری روبین را با قابلیت محاسبهٔ ۱۰۷ (compute capability 107) بهصورت پیشنمایش اضافه کرده تا توسعهدهندگان پیش از دسترسی عمومی کامل، انتقال برنامهها را آغاز کنند. در بخش کامپایلر، هدف معماری SM_107 برای روبین و سازگاری میزبان با GCC ۱۶ و Clang ۲۲ در پلتفرمهای پشتیبانیشده ذکر شده است.
MPS V3 لایهٔ کنترل مدرنتری برای اشتراک GPU معرفی میکند: رابط خط فرمان قابلاسکریپت، نمونههای نامدار سرور، فضای نام برای سازماندهی بارهای همزمان، پیکربندی TOML، کنترل پارتیشن SM و محدودیت حافظهٔ GPU یکپارچه با cgroup. هدف اعلامشده، پارتیشنبندی دقیقتر GPU در محیطهای کانتینری همراه با جداسازی منابع است.
قابلیت CUDA Compute Fabric Transport نیز برای توسعهدهندگان کتابخانههای ارتباطی سطح پایین معرفی شده تا داده را روی پارچهٔ NVLink با نقاط پایانی منطقی نامدار و عملیات ناهمگام put/get/reduction جابهجا کنند؛ انویدیا تأکید کرده بیشتر برنامهنویسان کاربردی بهتر است همچنان از کتابخانههایی مثل NCCL یا NVSHMEM استفاده کنند.
CUDA Python، CCCL و ابزارهای توسعهدهنده
در بخش پایتون، cuda.core نسخهٔ ۱٫۱٫۰ برنامهنویسی texture و surface، حافظهٔ مدیریتشدهٔ آگاه از NUMA و فایلهای type stub با پسوند pyi را گسترش داده است. cuda.compute ۱٫۱ امکان کامپایل پیشاپیش الگوریتمهای CCCL برای چند معماری GPU — حتی روی سامانههای بدون GPU — را فراهم میکند. CCCL ۳٫۴ نیز پیادهسازی warp-specialized تازهای از cub::DeviceScan روی Blackwell اعلام کرده که در بنچمارکهای گزارششده تا حدود ۹۲٪ بهرهوری از پهنای باند حافظه رسیده است.
از دیگر نکات اعلامشده میتوان به جداشدن نصب درایور از بستههای Toolkit در نصبکنندههای SDK، پیشفرضشدن Coherent Driver-based Memory Management روی پلتفرمهای همدوس مثل Grace Hopper و Grace Blackwell، و بهروزرسانیهای Nsight Compute، Nsight Python ۱٫۰، Compute Sanitizer و کتابخانههای ریاضی هستهای اشاره کرد. برای جزئیات سازگاری، انویدیا به یادداشت انتشار CUDA Toolkit ۱۳٫۴ ارجاع داده است.
منبع: NVIDIA Technical Blog.
آیا گسترش رسمی CUDA به ویندوز روی آرم، مسیر توسعهٔ نرمافزار GPU روی لپتاپهای مبتنی بر SoC آرم را تغییر میدهد؟