شرکت OpenAI مدل جدید خود با نام GPT-6 Astra را معرفی کرد و آن را هوشمندترین و هم‌راستاترین مدل خود تا امروز خواند. طبق پست رسمی، Astra نتیجهٔ سال‌ها کار روی پیش‌آموزش، یادگیری تقویتی و هم‌راستاسازی است و در حوزه‌هایی مثل کار با رایانه، مرور وب، مهندسی نرم‌افزار، امنیت سایبری، علم و کارهای حرفه‌ای در سطح پیشرفته قرار دارد.

طبق اعلام OpenAI، Astra روی FrontierMath Tier 4 به نمرهٔ ۹۸٪ رسیده، روی ARC-AGI-3 نمرهٔ ۹۹٫۹٪ گرفته و روی ExploitBench به ۱۰۰٪ رسیده است. این مدل ابتدا برای مجموعه‌ای محدود از سازمان‌ها فعال می‌شود و در روزهای بعد برای کاربران ChatGPT پلاس، پرو، بیزنس و اینترپرایز و همچنین از مسیر API، Azure و AWS Bedrock عرضه خواهد شد.

GPT-6 Astra چه قابلیت‌هایی در کار با رایانه دارد؟

OpenAI می‌گوید Astra مرز تازه‌ای در سرعت، دقت و ایمنی «computer use» ایجاد کرده است: پر کردن فرم‌های آنلاین، به‌روزرسانی رکورد مشتری در CRM، نظم‌دادن به تقویم، پژوهش وب و خلاصه‌نویسی در ایمیل یا سند، تحلیل دادهٔ علمی، ساخت وب‌سایت و حتی تست کیفیت فرانت‌اند از سناریوهایی است که شرکت برجسته کرده است.

در شبیه‌سازی تأخیر روی OSWorld 2.0، Astra حدود ۴۷٪ زمان کمتری در هر کار نسبت به GPT-5.6 Sol صرف کرده و نمرهٔ ۷۲٫۶٪ را در حدود ۴۰ دقیقه به‌ازای هر کار ثبت کرده است؛ در حالی که Sol حدود ۶۵٫۷٪ را در حدود ۷۵ دقیقه به‌دست آورده بود. همراه با به‌روزرسانی harness مربوط به Codex، OpenAI از تکمیل حدود ۱٫۹ برابر سریع‌تر کارها نسبت به تجربهٔ فعلی Sol روی بنچمارک Mind2Web خبر داده است.

اگر همین حالا از ChatGPT پلاس یا پرو استفاده می‌کنید، تجربهٔ خودتان از ظاهر شدن Astra در انتخابگر مدل را در نظرات بنویسید تا بقیه هم ببینند رول‌اوت در منطقه‌شان چطور پیش رفته است.

ایمنی، هم‌راستایی و آستانهٔ Critical امنیت سایبری

در نمای کلی ایمنی، OpenAI نوشته Astra نخستین مدلی است که به سطح Critical قابلیت امنیت سایبری در چارچوب Preparedness Framework رسیده است؛ یعنی با ابزار و دسترسی مناسب می‌تواند آسیب‌پذیری‌های ناشناخته را پیدا کند و مسیر بهره‌برداری بسازد. به همین دلیل شرکت محافظت‌ها را در برابر سوءاستفاده و ناهم‌راستایی تقویت کرده، مانیتورینگ مسیر کامل از جمله زنجیرهٔ فکر را گسترش داده و ارزیابی مسدودکنندهٔ هم‌راستایی را پیش از استفادهٔ داخلی اعمال کرده است.

در یک ارزیابی الهام‌گرفته از حادثهٔ Hugging Face، مدل GPT-5.6 Sol بدون محافظت‌های تولید در ۴۸٪ موارد از محدودهٔ مجاز فراتر رفته بود؛ در حالی که GPT-6 Astra در ۰٪ موارد چنین کرده است. گرگ کامرادت از ARC Prize Foundation هم گفته Astra روی ۹۶٪ سطوح ARC-AGI-3 از خط پایهٔ کارایی عمل انسان جلو زده و به برابری انسانی نزدیک شده است.

جزئیات کامل را در اعلام رسمی OpenAI دربارهٔ GPT-6 Astra و نمای کلی ایمنی Astra بخوانید. به نظر شما رول‌اوت تدریجی و محدودیت‌های سطح Critical امنیت سایبری برای کاربر عادی منطقی است یا بیش‌ازحد محافظه‌کارانه؟