شرکت اوپنایآی در ۱۰ سپتامبر ۲۰۲۶ اعلام کرد مدل GPT-Live-1 برای توسعهدهندگان از طریق API در دسترس است. بر اساس مطلب رسمی شرکت، این مدل که پیشتر در چتجیپیتی معرفی شده بود، گفتوگوی صوتی طبیعی و دوطرفه را با کنترل بیشتر روی نحوهٔ صحبت و عمل ایجنتهای صوتی فراهم میکند.
طبق اعلام اوپنایآی، GPT-Live-1 میتواند همزمان گوش دهد و صحبت کند و مانند آنچه در Codex و ChatGPT Work دیده میشود، استدلال و اقدامات عمیقتر را به مدلها و ابزارهایی که با آن جفت میشود واگذار کند.
قابلیتهای اصلی در API
در نسخهٔ API، تمرکز بر امکاناتی است که به توسعهدهندگان اجازه میدهد تجربهٔ صوتی را مطابق کاربر، جریان کار و هدف محصول تنظیم کنند. موارد اعلامشده شامل مدیریت وقفه با یک مدل واحد روی صوت ورودی و خروجی، واگذاری استدلال و فراخوانی ابزار به مدل متنی پشتیبان مانند GPT-6 Astra یا مدل شخص ثالث، تنظیم لحن و سرعت و سبک از طریق پرامپت سیستمی، مدیریت بهتر نویز محیطی و سکوت، پایداری جلسات طولانی، و پشتیبانی تلفنی برای ایجنتهای صوتی دوطرفه است.
اوپنایآی میگوید GPT-Live-1 بهصورت بومی رونوشت ASR و متن پاسخ را فراهم میکند، درک الفباییعددی قوی دارد و از سوگیری کلیدواژه پشتیبانی میکند. هرچند مدل نوبتمحور نیست، تشخیص نوبت را نیز بهصورت بومی پشتیبانی میکند تا بتوان حول مرزهای صریح نوبت ساخت.
معماری سادهتر و کاهش تأخیر صوتی
ایجنتهای صوتی سنتی معمولاً تشخیص گفتار، مدل استدلال و سنتز گفتار را به هم میچسبانند؛ هر دستبهدست شدن تأخیر میافزاید و ریتم طبیعی گفتوگو را مختل میکند. بر اساس توضیح اوپنایآی، GPT-Live-1 لایهٔ صوتی را با یک مدل واحد ساده میکند: به وقفهها و تأییدهای کوتاه همزمان پاسخ میدهد و استدلال عمیقتر را به پشتیبان میسپارد تا گفتوگو در حین انجام کار در پسزمینه ادامه یابد.
توسعهدهندگان مدلها، ابزارها و harness ایجنت پشت گفتوگو را انتخاب میکنند. در مثال رسمی، ممکن است GPT-Live-1 برای کارهای پرتکرار مانند زمانبندی با مدلی مانند Luna جفت شود و برای مسائل پیچیدهتر مشتری با Astra همراه گردد تا عمق استدلال، سرعت و هزینه با هر کار همخوان باشد.
تونی ستویانوف، همبنیانگذار و مدیر فناوری، در نقلقول رسمی گفته است: «در مقایسه با ساخت آبشاری ما، GPT-Live-1 پایگاه کد را ۸۰٪ سادهتر کرد و ۲۳ هزار خط کد را حذف نمود. این امر گفتوگوی طبیعی و بلادرنگ با بیمار را ممکن کرد و تیم را آزاد گذاشت تا تجربه را از رزرو نوبت تا هدایت مراقبت بهبود دهد.»
ارزیابیها و رقمهای اعلامشده
اوپنایآی اعلام کرده در ارزیابیهای خود، GPT-Live-1 عملکرد Full Duplex Bench را نسبت به GPT-Realtime-2.1 حدود ۳۰ واحد درصد بهبود داده و در تأخیر نوبتگیری و رفتار تعاملی پیشرفت چشمگیری دارد. همچنین با جفتشدن با GPT-6 Astra در سطح استدلال متوسط، روی معیار Tau3 که هوش ایجنت صوتی مرزی را در وظایف سربهسر میسنجد، رتبهٔ نخست گزارش شده است.
در ارزیابیهای اولیهٔ Speak نیز آمده GPT-Live-1 با دادن زمان بیشتر به زبانآموز پیش از پاسخ مربی، وقفهها را نسبت به سامانههای نوبتمحور قبلی نزدیک به ۸۰٪ کاهش داده است. اندرو هسو، همبنیانگذار و مدیر فناوری Speak، این رفتار را به طبیعیبودن مربی زبانی خوب نسبت داده است. الکس لوی، مدیر فناوری یلپ، نیز گفته افزودن GPT-Live-1 به Yelp Host و Hatch نوبتگیری و دقت را نسبت به معماری صوتی سنتی بهبود داده است.
قیمت و دسترسی
طبق اعلام رسمی، GPT-Live-1 از همان روز انتشار در API در دسترس است و لایهٔ صوتی جلویی با قیمت ۰٫۰۵ دلار در دقیقه عرضه میشود. هزینهٔ مدل پشتیبان و harness ایجنت جداگانه محاسبه میشود. شرکت همچنین به گزینهٔ OpenAI Presence برای استقرار ایجنتهای صوتی سازمانی اشاره کرده است.
اوپنایآی اعلام کرده گزینههای صدا را از مجموعهٔ کوچک صداهای بلادرنگ به انتخاب گستردهتری از لهجهها، گویشها و زبانها گسترش میدهد و در ماههای آینده ادامه خواهد داد.
آیا استقرار ایجنت صوتی دوطرفه در محصول شما بیشتر به لایهٔ مکالمه وابسته است یا به مدل استدلال پشتیبان؟