وقتی چند زیرعامل هم‌زمان روی یک پی‌سی محلی کار می‌کنند، صف استنتاج روی همان GPU سنگین می‌شود؛ حتی اگر لپ‌تاپ یا ورک‌استیشن دیگری روی شبکهٔ خانگی بیکار باشد. بلاگ فنی انویدیا ابزار NVIDIA PAIR (Personal AI Router) را برای همین گلوگاه معرفی کرده است: یک مسیریاب مجازی استنتاج که درخواست‌های مستقل را به سیستم آماده‌ای روی شبکهٔ محلی می‌فرستد.

PAIR موتور استنتاج تازه نیست؛ همان Ollama یا LM Studio مدل را اجرا می‌کند. PAIR سیستم‌ها را کشف می‌کند، آماده‌بودن هر گره را پیگیری می‌کند، کار مستقل را زمان‌بندی می‌کند و پاسخ را به اپلیکیشن مبدأ برمی‌گرداند. ایجنت همان رابط آشنای محلی را می‌بیند و لازم نیست API کلاستر جداگانه‌ای یاد بگیرد.

پیش‌نیازها

  • سیستم‌عامل: نسخهٔ بتای PAIR برای ویندوز، مک‌اواس و لینوکس با رابط گرافیکی و ترمینال اعلام شده است.
  • سخت‌افزار پشتیبانی‌شده: GPUهای GeForce RTX سری ۲۰ و جدیدتر، GPUهای ورک‌استیشن RTX PRO (از معماری Turing به بعد)، NVIDIA DGX Spark، و سیلیکون Apple M4 یا جدیدتر.
  • رم و دیسک: صفحهٔ رسمی محصول حداقل حدود ۸ گیگابایت رم و فضای دیسک توصیه‌شده حدود ۲۰ گیگابایت یا بیشتر را ذکر کرده است.
  • شبکهٔ محلی: گره‌ها باید روی یک LAN مشترک باشند. کشف با mDNS انجام می‌شود؛ در صورت نیاز می‌توانید گره را با IP هم اضافه کنید.
  • موتور استنتاج: روی هر گرهٔ واجد شرایط باید Ollama یا LM Studio فعال باشد و همان تگ مدل درخواستی آنجا موجود باشد.
  • اینترنت: عملیات روزمرهٔ PAIR به اینترنت نیاز ندارد؛ دانلود مدل جداگانه است. پلی‌بوک نصب انویدیا زمان تقریبی را حدود ۱۰ دقیقه به‌علاوهٔ زمان دانلود موتور و مدل اعلام کرده است.

نصب و جفت‌سازی گام‌به‌گام

  1. دانلود بتا: بستهٔ PAIR را برای سیستم پشتیبانی‌شده (ویندوز، مک‌اواس یا لینوکس) از مسیر رسمی انویدیا بگیرید.
  2. نصب روی گره‌ها: PAIR را روی همهٔ پی‌سی‌های RTX، ورک‌استیشن‌های RTX PRO یا سیستم‌های DGX Spark که می‌خواهید در خوشه باشند نصب کنید.
  3. کشف و جفت‌سازی امن: سیستم‌ها را روی شبکهٔ محلی پیدا کنید و درخواست جفت‌سازی امن را تأیید کنید. ارتباط گره‌ها تا برقراری pairing امن مسدود است و سپس با mTLS و گواهی تولیدشده رمزنگاری می‌شود.
  4. موتور و مدل: روی گره‌های واجد شرایط، Ollama یا LM Studio را فعال کنید و مدل موردنیاز را دانلود یا قرار دهید. گره فقط وقتی واجد شرایط است که موتور فعال باشد و همان تگ مدل درخواستی آنجا موجود باشد.
  5. اجرای ایجنت سازگار: ایجنتی که از Ollama یا LM Studio استفاده می‌کند را روی سیستمی که PAIR نصب دارد اجرا کنید تا درخواست‌ها از endpoint محلی پراکسی‌شده عبور کنند.

PAIR چه کاری می‌کند و چه کاری نمی‌کند؟

  • هر درخواست را به یک گره واجد شرایط می‌فرستد و همان‌جا تا پایان اجرا نگه می‌دارد.
  • GPUها را ادغام نمی‌کند، VRAM را روی هم نمی‌ریزد و یک درخواست استنتاج را بین چند ماشین خرد نمی‌کند.
  • فایدهٔ اصلی برای بارهایی است که چند درخواست مستقل هم‌زمان دارند؛ مثل چند زیرعامل یا چند ابزار AI محلی موازی.

در دموی غیررسمی با Hermes Desktop و Ollama، بار پنج‌زیرعاملی روی یک لپ‌تاپ RTX Spark با مدل Qwen 3.6 35B A3B به‌طور میانگین حدود ۱۸ دقیقه طول کشید؛ همان بار روی خوشهٔ سه‌دستگاهی (لپ‌تاپ RTX Spark، DGX Spark و RTX 5090) به‌طور میانگین حدود ۸ دقیقه و ۴۸ ثانیه. انویدیا صریحاً می‌گوید این یک بنچمارک عمومی یا وعدهٔ مقیاس خطی نیست و به موازی‌بودن بار، مدل، تنظیمات موتور، سخت‌افزار و شبکه بستگی دارد.

نکتهٔ راستی‌آزمایی: برای مشاهدهٔ محل اجرای واقعی، نمای Jobs در PAIR معیار است؛ چون تعداد ایجنت Hermes با تعداد jobهای PAIR یکی نیست و یک ایجنت می‌تواند چند درخواست مدل بسازد.

نکات امنیتی و اشکال‌یابی رایج

  • تا قبل از تأیید pairing، ارتباط بین گره‌ها مسدود می‌ماند؛ درخواست جفت‌سازی را فقط برای دستگاه‌های مورد اعتماد بپذیرید.
  • اگر گره‌ای در کشف دیده نمی‌شود، mDNS، فایروال محلی و اتصال به همان LAN را بررسی کنید؛ افزودن با IP گزینهٔ جایگزین است.
  • اگر کار به گره نمی‌رود، اول موتور و وجود همان تگ مدل را روی آن گره چک کنید — نه فقط نصب PAIR.

جزئیات کامل را در پست فنی انویدیا درباره NVIDIA PAIR بخوانید.

اگر همین حالا روی خانه دو سیستم RTX دارید یا فقط یک لپ‌تاپ، تجربهٔ نصب و جفت‌سازی‌تان را در نظرات بنویسید.