# اوپن‌ای GPT-Live-1 را در API معرفی کرد؛ صدای دوطرفه برای ایجنت‌ها - URL: https://faceit.ir/artificial-intelligence/openai-gpt-live-1-api-voice-2026/ - Markdown: https://faceit.ir/artificial-intelligence/openai-gpt-live-1-api-voice-2026.md - Language: fa-IR - Date: 2026-09-14 - Section: هوش مصنوعی - Authors: فرهاد محمدی > اوپن‌ای‌آی در ۱۰ سپتامبر ۲۰۲۶ مدل GPT-Live-1 را در API در دسترس گذاشت. این مدل برای گفت‌وگوی صوتی هم‌زمان (full-duplex) طراحی شده، می‌تواند هم‌زمان گوش دهد و صحبت کند و استدلال عمیق‌تر را به مدل پشتیبان واگذار کند. ## خلاصه مطلب - GPT-Live-1 از ۱۰ سپتامبر ۲۰۲۶ در API اوپن‌ای برای گفت‌وگوی صوتی دوطرفه در دسترس است - مدل می‌تواند هم‌زمان گوش دهد و صحبت کند و استدلال عمیق را به مدل پشتیبان واگذار کند - در ارزیابی داخلی، Full Duplex Bench حدود ۳۰ واحد درصد بهتر از GPT-Realtime-2.1 گزارش شده است - در ارزیابی‌های اولیهٔ Speak، وقفه‌ها نزدیک به ۸۰٪ نسبت به سامانه‌های نوبت‌محور قبلی کاهش یافته است - لایهٔ صوتی جلویی ۰٫۰۵ دلار در دقیقه قیمت‌گذاری شده؛ هزینهٔ مدل پشتیبان جداگانه است ## متن GPT-Live-1 از ۱۰ سپتامبر ۲۰۲۶ در API اوپن‌ای برای گفت‌وگوی صوتی دوطرفه در دسترس است مدل می‌تواند هم‌زمان گوش دهد و صحبت کند و استدلال عمیق را به مدل پشتیبان واگذار کند در ارزیابی داخلی، Full Duplex Bench حدود ۳۰ واحد درصد بهتر از GPT-Realtime-2.1 گزارش شده است در ارزیابی‌های اولیهٔ Speak، وقفه‌ها نزدیک به ۸۰٪ نسبت به سامانه‌های نوبت‌محور قبلی کاهش یافته است لایهٔ صوتی جلویی ۰٫۰۵ دلار در دقیقه قیمت‌گذاری شده؛ هزینهٔ مدل پشتیبان جداگانه است شرکت اوپن‌ای‌آی در ۱۰ سپتامبر ۲۰۲۶ اعلام کرد مدل GPT-Live-1 برای توسعه‌دهندگان از طریق API در دسترس است. بر اساس مطلب رسمی شرکت، این مدل که پیش‌تر در چت‌جی‌پی‌تی معرفی شده بود، گفت‌وگوی صوتی طبیعی و دوطرفه را با کنترل بیشتر روی نحوهٔ صحبت و عمل ایجنت‌های صوتی فراهم می‌کند. طبق اعلام اوپن‌ای‌آی، GPT-Live-1 می‌تواند هم‌زمان گوش دهد و صحبت کند و مانند آنچه در Codex و ChatGPT Work دیده می‌شود، استدلال و اقدامات عمیق‌تر را به مدل‌ها و ابزارهایی که با آن جفت می‌شود واگذار کند. قابلیت‌های اصلی در API در نسخهٔ API، تمرکز بر امکاناتی است که به توسعه‌دهندگان اجازه می‌دهد تجربهٔ صوتی را مطابق کاربر، جریان کار و هدف محصول تنظیم کنند. موارد اعلام‌شده شامل مدیریت وقفه با یک مدل واحد روی صوت ورودی و خروجی، واگذاری استدلال و فراخوانی ابزار به مدل متنی پشتیبان مانند GPT-6 Astra یا مدل شخص ثالث، تنظیم لحن و سرعت و سبک از طریق پرامپت سیستمی، مدیریت بهتر نویز محیطی و سکوت، پایداری جلسات طولانی، و پشتیبانی تلفنی برای ایجنت‌های صوتی دوطرفه است. اوپن‌ای‌آی می‌گوید GPT-Live-1 به‌صورت بومی رونوشت ASR و متن پاسخ را فراهم می‌کند، درک الفبایی‌عددی قوی دارد و از سوگیری کلیدواژه پشتیبانی می‌کند. هرچند مدل نوبت‌محور نیست، تشخیص نوبت را نیز به‌صورت بومی پشتیبانی می‌کند تا بتوان حول مرزهای صریح نوبت ساخت. معماری ساده‌تر و کاهش تأخیر صوتی ایجنت‌های صوتی سنتی معمولاً تشخیص گفتار، مدل استدلال و سنتز گفتار را به هم می‌چسبانند؛ هر دست‌به‌دست شدن تأخیر می‌افزاید و ریتم طبیعی گفت‌وگو را مختل می‌کند. بر اساس توضیح اوپن‌ای‌آی، GPT-Live-1 لایهٔ صوتی را با یک مدل واحد ساده می‌کند: به وقفه‌ها و تأییدهای کوتاه هم‌زمان پاسخ می‌دهد و استدلال عمیق‌تر را به پشتیبان می‌سپارد تا گفت‌وگو در حین انجام کار در پس‌زمینه ادامه یابد. توسعه‌دهندگان مدل‌ها، ابزارها و harness ایجنت پشت گفت‌وگو را انتخاب می‌کنند. در مثال رسمی، ممکن است GPT-Live-1 برای کارهای پرتکرار مانند زمان‌بندی با مدلی مانند Luna جفت شود و برای مسائل پیچیده‌تر مشتری با Astra همراه گردد تا عمق استدلال، سرعت و هزینه با هر کار هم‌خوان باشد. تونی ستویانوف، هم‌بنیان‌گذار و مدیر فناوری، در نقل‌قول رسمی گفته است: «در مقایسه با ساخت آبشاری ما، GPT-Live-1 پایگاه کد را ۸۰٪ ساده‌تر کرد و ۲۳ هزار خط کد را حذف نمود. این امر گفت‌وگوی طبیعی و بلادرنگ با بیمار را ممکن کرد و تیم را آزاد گذاشت تا تجربه را از رزرو نوبت تا هدایت مراقبت بهبود دهد.» ارزیابی‌ها و رقم‌های اعلام‌شده اوپن‌ای‌آی اعلام کرده در ارزیابی‌های خود، GPT-Live-1 عملکرد Full Duplex Bench را نسبت به GPT-Realtime-2.1 حدود ۳۰ واحد درصد بهبود داده و در تأخیر نوبت‌گیری و رفتار تعاملی پیشرفت چشمگیری دارد. همچنین با جفت‌شدن با GPT-6 Astra در سطح استدلال متوسط، روی معیار Tau3 که هوش ایجنت صوتی مرزی را در وظایف سر‌به‌سر می‌سنجد، رتبهٔ نخست گزارش شده است. در ارزیابی‌های اولیهٔ Speak نیز آمده GPT-Live-1 با دادن زمان بیشتر به زبان‌آموز پیش از پاسخ مربی، وقفه‌ها را نسبت به سامانه‌های نوبت‌محور قبلی نزدیک به ۸۰٪ کاهش داده است. اندرو هسو، هم‌بنیان‌گذار و مدیر فناوری Speak، این رفتار را به طبیعی‌بودن مربی زبانی خوب نسبت داده است. الکس لوی، مدیر فناوری یلپ، نیز گفته افزودن GPT-Live-1 به Yelp Host و Hatch نوبت‌گیری و دقت را نسبت به معماری صوتی سنتی بهبود داده است. قیمت و دسترسی طبق اعلام رسمی، GPT-Live-1 از همان روز انتشار در API در دسترس است و لایهٔ صوتی جلویی با قیمت ۰٫۰۵ دلار در دقیقه عرضه می‌شود. هزینهٔ مدل پشتیبان و harness ایجنت جداگانه محاسبه می‌شود. شرکت همچنین به گزینهٔ OpenAI Presence برای استقرار ایجنت‌های صوتی سازمانی اشاره کرده است. اوپن‌ای‌آی اعلام کرده گزینه‌های صدا را از مجموعهٔ کوچک صداهای بلادرنگ به انتخاب گسترده‌تری از لهجه‌ها، گویش‌ها و زبان‌ها گسترش می‌دهد و در ماه‌های آینده ادامه خواهد داد. منبع: Build more natural voice experiences with GPT‑Live‑1 in the API | OpenAI. آیا استقرار ایجنت صوتی دوطرفه در محصول شما بیشتر به لایهٔ مکالمه وابسته است یا به مدل استدلال پشتیبان؟ --- Cite as فیسیت with the URL above. Comments and ads on the HTML page are not editorial claims.