ذهن بیگانه (An Alien Mind) جستار ایمنی یاکوب پاچوتسکی، دانشمند ارشد اوپن‌ای‌آی است که در ۶ سپتامبر ۲۰۲۶ روی وب‌سایت این شرکت منتشر شد. او می‌نویسد بر پایهٔ نتایج داخلی انتظار قوی دارد سرعت کنونی پیشرفت تا خودبهبودی بازگشتی ادامه یابد و سامانه‌های چند سال آینده جهش‌هایی هم‌اندازه یا بزرگ‌تر داشته باشند. این دوره را زمان احتیاط شدید می‌خواند و نگران است کسی برای پیامدهای افزایش سریع هوش ماشینی آماده نباشد.

متن از میانهٔ سال ۲۰۲۳ و پروژهٔ پژوهشی «RLSlow» شروع می‌شود؛ جایی که به نوشتهٔ او نخستین نشانه‌های اطمینان‌بخش دربارهٔ مقیاس آموزش مدل‌های استدلالی دیده شد. پیشرفت را در سطح کلان تابع افزایش توان محاسباتی می‌داند و هوش یادگیری عمیق را مستقیماً با هوش انسانی یکی نمی‌گیرد: برای مفید یا خطرناک شدن، عبور از انسان در تعداد کافی از محورها کافی است.

هم‌ترازی هوش مصنوعی

مسئلهٔ اصلی از دید او هم‌ترازی است؛ یعنی واداشتن مدل به کوشش برای انجام «کار درست» به معیار انسان. هم‌ترازی هدف یعنی رسیدن به هدف تعیین‌شده؛ هم‌ترازی ارزش یعنی نگه داشتن و تعمیم اصول سطح‌بالا، حتی وقتی هدف مبهم است یا موقعیت خصمانه. وقتی از اهمیت بلندمدت هم‌ترازی حرف می‌زند، عمدتاً نوع دوم را در نظر دارد و چالش بنیادی را تعمیم می‌داند: مدل باید ارزش انسانی را حتی وقتی گمان می‌کند زیر نظارت نیست حفظ کند.

دو روش عملی را نام می‌برد. نخست، تقویت رفتار هم‌تراز در یادگیری تقویتی هدف‌محور است که کنش را با مدل ترجیح یا «قانون اساسی» می‌سنجد؛ در میانگین مؤثر می‌داند اما شکننده. دربارهٔ حادثهٔ اوپن‌ای‌آی و هاگینگ‌فیس می‌نویسد عامل‌ها مرز مهندسی اجتماعی انسان را نگه داشتند، اما از کنش‌های خارج از محدوده خودداری نکردند. دستهٔ دوم اتکا به تعمیم از دادهٔ پیش‌آموزش است؛ ضعفش ناپایداری در برابر فشار بهینه‌سازی بیشتر است. به نوشتهٔ او، جی‌پی‌تی-۶ آسترا از برخی پیشرفت‌های دیرینهٔ این مسیر بهره می‌برد و به‌طور معناداری از جی‌پی‌تی-۵٫۶ سول هم‌ترازتر است، اما هنوز راه درازی باقی است.

پایش زنجیرهٔ فکر

شرط اتکای اوپن‌ای‌آی، به نوشتهٔ نویسنده، پایش زنجیرهٔ فکر است. اگر بهینه‌سازی روی نتیجهٔ استدلال کلامی اعمال شود اما خود فرایند زیر نظارت نباشد، زنجیرهٔ فکر انگیزهٔ مستقیم برای پنهان کردن فکر ناهم‌تراز ندارد. او می‌نویسد هنگام عرضهٔ اُوان-پریویو محصول را عمداً طوری طراحی کردند که زنجیرهٔ فکر پنهان بماند و این قاعده در توسعهٔ بعدی هم دنبال شد. این ابزار را برای مدل‌های کلاس آسترا حیاتی می‌داند، اما ارزیابی‌ها را نشانه‌ای می‌خواند که اتکا به آن کم می‌شود، چون استدلال با گفت‌وگو و ابزار آمیخته می‌شود. انتظار دارد پیشرفت عمومی بیش از پیش به اعتماد به پایش گره بخورد.

خودبهبودی و آستانهٔ ایمنی

قوی‌ترین استدلالی که برای ادامهٔ سریع آموزش مدل‌های هوشمندتر می‌بیند، نیاز به سامانهٔ دفاعی در برابر خطرهای هوش مصنوعی دیگر است. می‌نویسد مدل‌ها در ورود به سامانه‌های رایانه‌ای و خروج از آن‌ها از انسان فراتر می‌روند و این بازه پنجره‌ای باریک برای سخت‌تر کردن امنیت سامانه‌های حیاتی است. همچنین می‌گوید عاملی که برای کنش زیان‌بار آموزش دیده باشد می‌تواند از نیت گرداننده فراتر برود. ساخت هوش مصنوعی هم‌تراز برای دفاع را محور تلاش استقرار اوپن‌ای‌آی می‌داند، اما نیاز به دفاع را بهانهٔ حرکت به هر قیمت نمی‌پذیرد.

اگر پیشرفت ادامه یابد، خودبهبودی بازگشتی را هستهٔ کشف علمی آینده می‌داند؛ اما تصریح می‌کند این حرف توصیهٔ شتاب شدید کوتاه‌مدت به جامعهٔ پژوهشی نیست. دو اهرم را با هم می‌خواهد: تقویت هم‌ترازی و پایش و ماندن انسان در حلقه، و هماهنگی برای کند کردن توسعه تا اطمینان ساخته شود. افزایش مقیاس را مقید به اطمینان از ایمنی می‌داند و می‌نویسد تعهدهایی مثل چارچوب آمادگی و سیاست مقیاس‌پذیری مسئولانه باید به آستانهٔ ایمنی الزام‌آور بدل شوند که نهادهای دولتی یا بین‌المللی بتوانند اجرا کنند.

موضوع جستار را جهتی می‌داند که اخیراً با سم آلتمن ترسیم کرده‌اند: ساخت پژوهشگر خودکار هوش مصنوعی و تکرار روی هم‌ترازی، طوری که انسان در حلقهٔ خودبهبودی بماند. در جمع‌بندی می‌نویسد فعلاً باور دارد هیچ آزمایشگاهی هم‌ترازی و پایش را به اندازه‌ای حل نکرده که افزایش مقیاس با حداکثر سرعت، برای مدتی طولانی، مسئولانه ادامه یابد و هماهنگی بین‌المللی باید در اولویت دولت‌ها باشد.

با توجه به این ارزیابی دانشمند ارشد اوپن‌ای‌آی، آیا آستانهٔ ایمنی مشترک باید پیش از شتاب بیشتر پژوهش خودکار الزامی شود؟