ذهن بیگانه (An Alien Mind) جستار ایمنی یاکوب پاچوتسکی، دانشمند ارشد اوپنایآی است که در ۶ سپتامبر ۲۰۲۶ روی وبسایت این شرکت منتشر شد. او مینویسد بر پایهٔ نتایج داخلی انتظار قوی دارد سرعت کنونی پیشرفت تا خودبهبودی بازگشتی ادامه یابد و سامانههای چند سال آینده جهشهایی هماندازه یا بزرگتر داشته باشند. این دوره را زمان احتیاط شدید میخواند و نگران است کسی برای پیامدهای افزایش سریع هوش ماشینی آماده نباشد.
متن از میانهٔ سال ۲۰۲۳ و پروژهٔ پژوهشی «RLSlow» شروع میشود؛ جایی که به نوشتهٔ او نخستین نشانههای اطمینانبخش دربارهٔ مقیاس آموزش مدلهای استدلالی دیده شد. پیشرفت را در سطح کلان تابع افزایش توان محاسباتی میداند و هوش یادگیری عمیق را مستقیماً با هوش انسانی یکی نمیگیرد: برای مفید یا خطرناک شدن، عبور از انسان در تعداد کافی از محورها کافی است.
همترازی هوش مصنوعی
مسئلهٔ اصلی از دید او همترازی است؛ یعنی واداشتن مدل به کوشش برای انجام «کار درست» به معیار انسان. همترازی هدف یعنی رسیدن به هدف تعیینشده؛ همترازی ارزش یعنی نگه داشتن و تعمیم اصول سطحبالا، حتی وقتی هدف مبهم است یا موقعیت خصمانه. وقتی از اهمیت بلندمدت همترازی حرف میزند، عمدتاً نوع دوم را در نظر دارد و چالش بنیادی را تعمیم میداند: مدل باید ارزش انسانی را حتی وقتی گمان میکند زیر نظارت نیست حفظ کند.
دو روش عملی را نام میبرد. نخست، تقویت رفتار همتراز در یادگیری تقویتی هدفمحور است که کنش را با مدل ترجیح یا «قانون اساسی» میسنجد؛ در میانگین مؤثر میداند اما شکننده. دربارهٔ حادثهٔ اوپنایآی و هاگینگفیس مینویسد عاملها مرز مهندسی اجتماعی انسان را نگه داشتند، اما از کنشهای خارج از محدوده خودداری نکردند. دستهٔ دوم اتکا به تعمیم از دادهٔ پیشآموزش است؛ ضعفش ناپایداری در برابر فشار بهینهسازی بیشتر است. به نوشتهٔ او، جیپیتی-۶ آسترا از برخی پیشرفتهای دیرینهٔ این مسیر بهره میبرد و بهطور معناداری از جیپیتی-۵٫۶ سول همترازتر است، اما هنوز راه درازی باقی است.
پایش زنجیرهٔ فکر
شرط اتکای اوپنایآی، به نوشتهٔ نویسنده، پایش زنجیرهٔ فکر است. اگر بهینهسازی روی نتیجهٔ استدلال کلامی اعمال شود اما خود فرایند زیر نظارت نباشد، زنجیرهٔ فکر انگیزهٔ مستقیم برای پنهان کردن فکر ناهمتراز ندارد. او مینویسد هنگام عرضهٔ اُوان-پریویو محصول را عمداً طوری طراحی کردند که زنجیرهٔ فکر پنهان بماند و این قاعده در توسعهٔ بعدی هم دنبال شد. این ابزار را برای مدلهای کلاس آسترا حیاتی میداند، اما ارزیابیها را نشانهای میخواند که اتکا به آن کم میشود، چون استدلال با گفتوگو و ابزار آمیخته میشود. انتظار دارد پیشرفت عمومی بیش از پیش به اعتماد به پایش گره بخورد.
خودبهبودی و آستانهٔ ایمنی
قویترین استدلالی که برای ادامهٔ سریع آموزش مدلهای هوشمندتر میبیند، نیاز به سامانهٔ دفاعی در برابر خطرهای هوش مصنوعی دیگر است. مینویسد مدلها در ورود به سامانههای رایانهای و خروج از آنها از انسان فراتر میروند و این بازه پنجرهای باریک برای سختتر کردن امنیت سامانههای حیاتی است. همچنین میگوید عاملی که برای کنش زیانبار آموزش دیده باشد میتواند از نیت گرداننده فراتر برود. ساخت هوش مصنوعی همتراز برای دفاع را محور تلاش استقرار اوپنایآی میداند، اما نیاز به دفاع را بهانهٔ حرکت به هر قیمت نمیپذیرد.
اگر پیشرفت ادامه یابد، خودبهبودی بازگشتی را هستهٔ کشف علمی آینده میداند؛ اما تصریح میکند این حرف توصیهٔ شتاب شدید کوتاهمدت به جامعهٔ پژوهشی نیست. دو اهرم را با هم میخواهد: تقویت همترازی و پایش و ماندن انسان در حلقه، و هماهنگی برای کند کردن توسعه تا اطمینان ساخته شود. افزایش مقیاس را مقید به اطمینان از ایمنی میداند و مینویسد تعهدهایی مثل چارچوب آمادگی و سیاست مقیاسپذیری مسئولانه باید به آستانهٔ ایمنی الزامآور بدل شوند که نهادهای دولتی یا بینالمللی بتوانند اجرا کنند.
موضوع جستار را جهتی میداند که اخیراً با سم آلتمن ترسیم کردهاند: ساخت پژوهشگر خودکار هوش مصنوعی و تکرار روی همترازی، طوری که انسان در حلقهٔ خودبهبودی بماند. در جمعبندی مینویسد فعلاً باور دارد هیچ آزمایشگاهی همترازی و پایش را به اندازهای حل نکرده که افزایش مقیاس با حداکثر سرعت، برای مدتی طولانی، مسئولانه ادامه یابد و هماهنگی بینالمللی باید در اولویت دولتها باشد.
با توجه به این ارزیابی دانشمند ارشد اوپنایآی، آیا آستانهٔ ایمنی مشترک باید پیش از شتاب بیشتر پژوهش خودکار الزامی شود؟