وقتی چند زیرعامل همزمان روی یک پیسی محلی کار میکنند، صف استنتاج روی همان GPU سنگین میشود؛ حتی اگر لپتاپ یا ورکاستیشن دیگری روی شبکهٔ خانگی بیکار باشد. بلاگ فنی انویدیا ابزار NVIDIA PAIR (Personal AI Router) را برای همین گلوگاه معرفی کرده است: یک مسیریاب مجازی استنتاج که درخواستهای مستقل را به سیستم آمادهای روی شبکهٔ محلی میفرستد.
PAIR موتور استنتاج تازه نیست؛ همان Ollama یا LM Studio مدل را اجرا میکند. PAIR سیستمها را کشف میکند، آمادهبودن هر گره را پیگیری میکند، کار مستقل را زمانبندی میکند و پاسخ را به اپلیکیشن مبدأ برمیگرداند. ایجنت همان رابط آشنای محلی را میبیند و لازم نیست API کلاستر جداگانهای یاد بگیرد.
پیشنیازها
- سیستمعامل: نسخهٔ بتای PAIR برای ویندوز، مکاواس و لینوکس با رابط گرافیکی و ترمینال اعلام شده است.
- سختافزار پشتیبانیشده: GPUهای GeForce RTX سری ۲۰ و جدیدتر، GPUهای ورکاستیشن RTX PRO (از معماری Turing به بعد)، NVIDIA DGX Spark، و سیلیکون Apple M4 یا جدیدتر.
- رم و دیسک: صفحهٔ رسمی محصول حداقل حدود ۸ گیگابایت رم و فضای دیسک توصیهشده حدود ۲۰ گیگابایت یا بیشتر را ذکر کرده است.
- شبکهٔ محلی: گرهها باید روی یک LAN مشترک باشند. کشف با mDNS انجام میشود؛ در صورت نیاز میتوانید گره را با IP هم اضافه کنید.
- موتور استنتاج: روی هر گرهٔ واجد شرایط باید Ollama یا LM Studio فعال باشد و همان تگ مدل درخواستی آنجا موجود باشد.
- اینترنت: عملیات روزمرهٔ PAIR به اینترنت نیاز ندارد؛ دانلود مدل جداگانه است. پلیبوک نصب انویدیا زمان تقریبی را حدود ۱۰ دقیقه بهعلاوهٔ زمان دانلود موتور و مدل اعلام کرده است.
نصب و جفتسازی گامبهگام
- دانلود بتا: بستهٔ PAIR را برای سیستم پشتیبانیشده (ویندوز، مکاواس یا لینوکس) از مسیر رسمی انویدیا بگیرید.
- نصب روی گرهها: PAIR را روی همهٔ پیسیهای RTX، ورکاستیشنهای RTX PRO یا سیستمهای DGX Spark که میخواهید در خوشه باشند نصب کنید.
- کشف و جفتسازی امن: سیستمها را روی شبکهٔ محلی پیدا کنید و درخواست جفتسازی امن را تأیید کنید. ارتباط گرهها تا برقراری pairing امن مسدود است و سپس با mTLS و گواهی تولیدشده رمزنگاری میشود.
- موتور و مدل: روی گرههای واجد شرایط، Ollama یا LM Studio را فعال کنید و مدل موردنیاز را دانلود یا قرار دهید. گره فقط وقتی واجد شرایط است که موتور فعال باشد و همان تگ مدل درخواستی آنجا موجود باشد.
- اجرای ایجنت سازگار: ایجنتی که از Ollama یا LM Studio استفاده میکند را روی سیستمی که PAIR نصب دارد اجرا کنید تا درخواستها از endpoint محلی پراکسیشده عبور کنند.
PAIR چه کاری میکند و چه کاری نمیکند؟
- هر درخواست را به یک گره واجد شرایط میفرستد و همانجا تا پایان اجرا نگه میدارد.
- GPUها را ادغام نمیکند، VRAM را روی هم نمیریزد و یک درخواست استنتاج را بین چند ماشین خرد نمیکند.
- فایدهٔ اصلی برای بارهایی است که چند درخواست مستقل همزمان دارند؛ مثل چند زیرعامل یا چند ابزار AI محلی موازی.
در دموی غیررسمی با Hermes Desktop و Ollama، بار پنجزیرعاملی روی یک لپتاپ RTX Spark با مدل Qwen 3.6 35B A3B بهطور میانگین حدود ۱۸ دقیقه طول کشید؛ همان بار روی خوشهٔ سهدستگاهی (لپتاپ RTX Spark، DGX Spark و RTX 5090) بهطور میانگین حدود ۸ دقیقه و ۴۸ ثانیه. انویدیا صریحاً میگوید این یک بنچمارک عمومی یا وعدهٔ مقیاس خطی نیست و به موازیبودن بار، مدل، تنظیمات موتور، سختافزار و شبکه بستگی دارد.
نکتهٔ راستیآزمایی: برای مشاهدهٔ محل اجرای واقعی، نمای Jobs در PAIR معیار است؛ چون تعداد ایجنت Hermes با تعداد jobهای PAIR یکی نیست و یک ایجنت میتواند چند درخواست مدل بسازد.
نکات امنیتی و اشکالیابی رایج
- تا قبل از تأیید pairing، ارتباط بین گرهها مسدود میماند؛ درخواست جفتسازی را فقط برای دستگاههای مورد اعتماد بپذیرید.
- اگر گرهای در کشف دیده نمیشود، mDNS، فایروال محلی و اتصال به همان LAN را بررسی کنید؛ افزودن با IP گزینهٔ جایگزین است.
- اگر کار به گره نمیرود، اول موتور و وجود همان تگ مدل را روی آن گره چک کنید — نه فقط نصب PAIR.
جزئیات کامل را در پست فنی انویدیا درباره NVIDIA PAIR بخوانید.
اگر همین حالا روی خانه دو سیستم RTX دارید یا فقط یک لپتاپ، تجربهٔ نصب و جفتسازیتان را در نظرات بنویسید.