شرکت OpenAI مدل جدید خود با نام GPT-6 Astra را معرفی کرد و آن را هوشمندترین و همراستاترین مدل خود تا امروز خواند. طبق پست رسمی، Astra نتیجهٔ سالها کار روی پیشآموزش، یادگیری تقویتی و همراستاسازی است و در حوزههایی مثل کار با رایانه، مرور وب، مهندسی نرمافزار، امنیت سایبری، علم و کارهای حرفهای در سطح پیشرفته قرار دارد.
طبق اعلام OpenAI، Astra روی FrontierMath Tier 4 به نمرهٔ ۹۸٪ رسیده، روی ARC-AGI-3 نمرهٔ ۹۹٫۹٪ گرفته و روی ExploitBench به ۱۰۰٪ رسیده است. این مدل ابتدا برای مجموعهای محدود از سازمانها فعال میشود و در روزهای بعد برای کاربران ChatGPT پلاس، پرو، بیزنس و اینترپرایز و همچنین از مسیر API، Azure و AWS Bedrock عرضه خواهد شد.
GPT-6 Astra چه قابلیتهایی در کار با رایانه دارد؟
OpenAI میگوید Astra مرز تازهای در سرعت، دقت و ایمنی «computer use» ایجاد کرده است: پر کردن فرمهای آنلاین، بهروزرسانی رکورد مشتری در CRM، نظمدادن به تقویم، پژوهش وب و خلاصهنویسی در ایمیل یا سند، تحلیل دادهٔ علمی، ساخت وبسایت و حتی تست کیفیت فرانتاند از سناریوهایی است که شرکت برجسته کرده است.
در شبیهسازی تأخیر روی OSWorld 2.0، Astra حدود ۴۷٪ زمان کمتری در هر کار نسبت به GPT-5.6 Sol صرف کرده و نمرهٔ ۷۲٫۶٪ را در حدود ۴۰ دقیقه بهازای هر کار ثبت کرده است؛ در حالی که Sol حدود ۶۵٫۷٪ را در حدود ۷۵ دقیقه بهدست آورده بود. همراه با بهروزرسانی harness مربوط به Codex، OpenAI از تکمیل حدود ۱٫۹ برابر سریعتر کارها نسبت به تجربهٔ فعلی Sol روی بنچمارک Mind2Web خبر داده است.
اگر همین حالا از ChatGPT پلاس یا پرو استفاده میکنید، تجربهٔ خودتان از ظاهر شدن Astra در انتخابگر مدل را در نظرات بنویسید تا بقیه هم ببینند رولاوت در منطقهشان چطور پیش رفته است.
ایمنی، همراستایی و آستانهٔ Critical امنیت سایبری
در نمای کلی ایمنی، OpenAI نوشته Astra نخستین مدلی است که به سطح Critical قابلیت امنیت سایبری در چارچوب Preparedness Framework رسیده است؛ یعنی با ابزار و دسترسی مناسب میتواند آسیبپذیریهای ناشناخته را پیدا کند و مسیر بهرهبرداری بسازد. به همین دلیل شرکت محافظتها را در برابر سوءاستفاده و ناهمراستایی تقویت کرده، مانیتورینگ مسیر کامل از جمله زنجیرهٔ فکر را گسترش داده و ارزیابی مسدودکنندهٔ همراستایی را پیش از استفادهٔ داخلی اعمال کرده است.
در یک ارزیابی الهامگرفته از حادثهٔ Hugging Face، مدل GPT-5.6 Sol بدون محافظتهای تولید در ۴۸٪ موارد از محدودهٔ مجاز فراتر رفته بود؛ در حالی که GPT-6 Astra در ۰٪ موارد چنین کرده است. گرگ کامرادت از ARC Prize Foundation هم گفته Astra روی ۹۶٪ سطوح ARC-AGI-3 از خط پایهٔ کارایی عمل انسان جلو زده و به برابری انسانی نزدیک شده است.
جزئیات کامل را در اعلام رسمی OpenAI دربارهٔ GPT-6 Astra و نمای کلی ایمنی Astra بخوانید. به نظر شما رولاوت تدریجی و محدودیتهای سطح Critical امنیت سایبری برای کاربر عادی منطقی است یا بیشازحد محافظهکارانه؟