مکالمه صوتی با هوش مصنوعی در سالهای اخیر پیشرفت زیادی کرده است، اما هنوز یک مشکل مهم باقی مانده: تأخیر و مکثهای غیرطبیعی در گفتوگو. کاربر باید صحبتش را تمام کند، سیستم پایان جمله را تشخیص دهد و سپس مدل شروع به پردازش و پاسخگویی کند. اگر این تشخیص زود انجام شود، صحبت کاربر قطع میشود و اگر دیر انجام شود، گفتوگو کند و مصنوعی به نظر میرسد.
OpenAI برای حل این مشکل از سیستم جدیدی به نام GPT-Live رونمایی کرده است؛ فناوریای که میتواند همزمان صدای کاربر را دریافت کند و پاسخ صوتی ارائه دهد. هدف این سیستم، نزدیک کردن مکالمه با هوش مصنوعی به ریتم طبیعی گفتوگوی انسانهاست.
GPT-Live چیست؟
GPT-Live نسل سوم سیستم صوتی OpenAI برای ایجاد مکالمههای سریع، پیوسته و بلادرنگ است. این فناوری به مدل اجازه میدهد بدون منتظر ماندن برای پایان کامل صحبت کاربر، جریان صدا را پردازش کند و در زمان مناسب پاسخ دهد.
در سیستمهای صوتی قدیمی، یک مدل کوچک به نام Turn Detector وظیفه داشت تشخیص دهد کاربر چه زمانی صحبتش را تمام کرده است. تنها پس از تصمیم این سیستم، مدل زبانی اصلی میتوانست پردازش درخواست را آغاز کند.
GPT-Live این تشخیصدهنده جداگانه را از مسیر اصلی صدا حذف کرده و کنترل جریان مکالمه را به خود مدل صوتی سپرده است. در نتیجه، مدل بهتر میتواند تشخیص دهد چه زمانی گوش دهد، چه زمانی صحبت کند و چه زمانی اجازه دهد کاربر پاسخ را قطع کند.
OpenAI این سیستم را در تاریخ ۳ اوت ۲۰۲۶ معرفی کرد و اعلام کرد که توسعه زیرساخت آن حدود شش ماه زمان برده است. این فناوری در حال حاضر پایه بخشی از قابلیتهای ChatGPT Voice را تشکیل میدهد.
GPT-Live چگونه کار میکند؟
مهمترین ویژگی GPT-Live، استفاده از معماری Full-Duplex یا ارتباط دوطرفه همزمان است.
در یک مکالمه صوتی معمولی با هوش مصنوعی، ارتباط اغلب نوبتی است:
- کاربر صحبت میکند.
- سیستم منتظر پایان صحبت میماند.
- مدل درخواست را پردازش میکند.
- پاسخ صوتی پخش میشود.
اما در GPT-Live، ورودی و خروجی صوتی میتوانند بهصورت همزمان جریان داشته باشند. مدل در حالی که صدای کاربر را دریافت میکند، میتواند صحبت کند، مکث کند یا واکنش کوتاهی نشان دهد.
این موضوع باعث میشود تعاملهایی مانند موارد زیر طبیعیتر شوند:
- کاربر وسط پاسخ سؤال جدیدی بپرسد.
- مدل هنگام شنیدن صحبت، واکنش کوتاهی مانند تأیید نشان دهد.
- سیستم بدون مکث طولانی وارد پاسخ بعدی شود.
- مکالمه از حالت پرسش و پاسخ خشک خارج شود.
OpenAI میگوید وظیفه اصلی معماری جدید، حفظ یک جریان صوتی بدون وقفه است. پردازش صدا در مسیر اصلی انجام میشود و کارهای سنگینتر مانند استفاده از ابزارها یا استدلال پیچیده، به مسیرهای جداگانه انتقال پیدا میکنند.
تفاوت GPT-Live با حالت صوتی قبلی ChatGPT چیست؟
نسلهای قبلی قابلیت صوتی ChatGPT نیز امکان گفتوگوی مستقیم را فراهم میکردند، اما معماری آنها همچنان تا حد زیادی به مکالمه نوبتی وابسته بود.
تفاوت اصلی GPT-Live را میتوان در جدول زیر مشاهده کرد:
| ویژگی | سیستم صوتی قبلی | GPT-Live |
|---|---|---|
| شیوه مکالمه | نوبتی | پیوسته و همزمان |
| تشخیص پایان صحبت | متکی به Turn Detector | کنترلشده توسط مدل |
| امکان قطع پاسخ | محدودتر | طبیعیتر و سریعتر |
| پردازش صوت | مرحلهای | جریان دائمی صوت |
| استفاده از مدلهای دیگر | ممکن است باعث مکث شود | در مسیر جداگانه انجام میشود |
| حس مکالمه | شبیه پرسش و پاسخ | نزدیکتر به گفتوگوی انسانی |
در روشهای قدیمیتر، حتی مدلهای Speech-to-Speech نیز برای شروع پردازش منتظر تصمیم تشخیصدهنده پایان صحبت میماندند. GPT-Live این محدودیت را کاهش میدهد و اجازه میدهد خود مدل صوتی مدیریت مکالمه را بر عهده بگیرد.
OpenAI چگونه تأخیر مکالمه صوتی را کاهش داده است؟
طبیعی بودن مکالمه فقط به قدرت مدل وابسته نیست. انتقال صدا، وضعیت شبکه، اجرای ابزارها و مدیریت سابقه مکالمه نیز میتوانند باعث ایجاد تأخیر شوند.
OpenAI برای کاهش این تأخیر، مسیر انتقال صدا را از منطق برنامه جدا کرده است. صوت میان دستگاه کاربر و مدل از یک مسیر سریع و اختصاصی عبور میکند؛ در حالی که کارهایی مانند جستوجو، فراخوانی ابزار یا اجرای سرویسهای جانبی در یک مسیر غیرهمزمان انجام میشوند.
بنابراین اگر یک ابزار یا سرویس خارجی با تأخیر پاسخ دهد، جریان صوتی مکالمه متوقف نمیشود.
همچنین OpenAI بخشی از زیرساخت قبلی مبتنی بر Python asyncio را با زبان Go بازنویسی کرده است. بر اساس توضیحات این شرکت، این تغییر باعث شده انتقال فریمهای صوتی روانتر و پایدارتر شود.
نقش WebRTC در GPT-Live
GPT-Live برای انتقال صوت از WebRTC استفاده میکند؛ فناوریای که برای ارتباطات صوتی و تصویری بلادرنگ طراحی شده است.
WebRTC میتواند در شرایطی مانند افت بستههای شبکه، تغییر اتصال یا ناهماهنگی زمانبندی همچنان ارتباط را حفظ کند. برای مثال، اگر بخشی از صدا دیر برسد، سیستم میتواند پخش آن را کمی تنظیم کند تا از ایجاد سکوت یا پرش صوتی جلوگیری شود.
پروتکل WARP چیست؟
راهاندازی معمولی WebRTC نیازمند چندین مرحله ارتباط میان کاربر و سرور است. این مراحل میتوانند شروع مکالمه را به تأخیر بیندازند.
OpenAI برای حل این مشکل، پروتکلی به نام WebRTC Abridged Roundtrip Protocol یا WARP توسعه داده است. این پروتکل تعداد رفتوبرگشتهای شبکه برای شروع انتقال صدا و داده را از شش مرحله به یک مرحله کاهش میدهد.
در کنار WARP، قابلیتی به نام Instant Connect نیز پارامترهای لازم برای اتصال را پیشاپیش آماده میکند. به این ترتیب، کاربر میتواند سریعتر وارد مکالمه صوتی شود.

نقش GPT-5.5 در GPT-Live چیست؟
GPT-Live برای پاسخهای سریع و مکالمه طبیعی طراحی شده است، اما همه درخواستها را بهتنهایی پردازش نمیکند.
اگر کاربر پرسشی مطرح کند که به استدلال عمیق، جستوجو یا استفاده از ابزار نیاز داشته باشد، GPT-Live میتواند از مدلهای قدرتمندتری مانند GPT-5.6 کمک بگیرد.
این فرایند در یک مسیر جداگانه انجام میشود. مدل صوتی میتواند در زمان پردازش درخواست، جریان گفتوگو را حفظ کند و پس از آماده شدن نتیجه، آن را وارد پاسخ کند.
OpenAI این معماری را جداسازی «صحبت کردن» از «تفکر عمیقتر» توصیف میکند. هدف این است که استفاده از مدلهای قدرتمند و ابزارها، باعث سکوت طولانی یا قطع مکالمه نشود.
GPT-Live چه کاربردهایی دارد؟
معماری GPT-Live میتواند زمینهساز نسل جدیدی از محصولات صوتی باشد. برخی از مهمترین کاربردهای آن عبارتاند از:
- دستیارهای شخصی صوتی: انجام وظایف روزمره، برنامهریزی و پاسخگویی طبیعیتر.
- خدمات مشتریان: ساخت اپراتورهای هوشمندی که بتوانند مکالمههای طولانی و چندمرحلهای را مدیریت کنند.
- آموزش زبان: تمرین مکالمه زنده، اصلاح تلفظ و پاسخگویی متناسب با صحبت زبانآموز.
- دستیارهای داخل خودرو: کنترل قابلیتها، مسیریابی و دریافت اطلاعات بدون لمس صفحه.
- ابزارهای دسترسپذیری: تسهیل استفاده از نرمافزارها برای افراد دارای محدودیتهای حرکتی یا بینایی.
- ایجنتهای هوشمند: هماهنگی چند ابزار یا عامل هوش مصنوعی از طریق فرمانهای صوتی.
OpenAI اعلام کرده است که این زیرساخت در ChatGPT Voice برای قابلیتهایی مانند کنترل رایانه و هماهنگ کردن ایجنتها در اپلیکیشن دسکتاپ ChatGPT نیز مورد استفاده قرار میگیرد.
آیا GPT-Live اکنون در دسترس کاربران است؟
فناوری پشت GPT-Live در حال حاضر بخشی از زیرساخت ChatGPT Voice است، اما OpenAI هنوز GPT-Live API را بهصورت عمومی منتشر نکرده است.
این شرکت اعلام کرده که معماری جدید، زیربنای API آینده GPT-Live خواهد بود. با عرضه این API، توسعهدهندگان میتوانند دستیارها، اپلیکیشنها و سرویسهای صوتی بلادرنگ خود را بر پایه این فناوری ایجاد کنند.
بنابراین باید میان این دو موضوع تفاوت قائل شد:
- کاربران ممکن است بخشی از فناوری GPT-Live را از طریق ChatGPT Voice تجربه کنند.
- API مستقل GPT-Live هنوز بهعنوان محصول عمومی آینده معرفی شده است.
GPT-Live چه تأثیری بر آینده دستیارهای صوتی دارد؟
GPT-Live نشان میدهد دستیارهای صوتی در حال عبور از مرحله اجرای فرمانهای کوتاه و ورود به دوره مکالمههای مداوم و هوشمند هستند.
کاهش تأخیر، امکان همپوشانی صحبتها و استفاده همزمان از ابزارها باعث میشود تعامل با هوش مصنوعی کمتر شبیه کار با یک نرمافزار و بیشتر شبیه صحبت با یک دستیار واقعی باشد.
البته کیفیت نهایی این تجربه همچنان به عواملی مانند سرعت اینترنت، ظرفیت سرورها، دقت مدل و نحوه پیادهسازی هر اپلیکیشن بستگی دارد. OpenAI نیز هنگام آزمایش سیستم متوجه شده که مقیاسپذیری مکالمات صوتی فقط به توان پردازندههای گرافیکی وابسته نیست و شبکه، پردازنده مرکزی، موقعیت جغرافیایی سرورها و مدیریت نشستهای طولانی نیز اهمیت زیادی دارند.
جمعبندی
GPT-Live نسل جدید سیستم صوتی OpenAI است که برای ایجاد مکالمهای سریعتر، پیوستهتر و طبیعیتر طراحی شده است. این فناوری با حذف تشخیصدهنده جداگانه پایان صحبت، استفاده از مدل Full-Duplex و جداسازی پردازش صوت از ابزارها و عملیات سنگین، تأخیر مکالمه را کاهش میدهد.
GPT-Live در زیرساخت ChatGPT Voice استفاده میشود و قرار است پایه API صوتی آینده OpenAI باشد. اگر این فناوری مطابق وعدههای OpenAI توسعه پیدا کند، میتواند مسیر ساخت دستیارهای صوتی، مراکز تماس هوشمند و ایجنتهای مکالمهای را تغییر دهد.
برای دنبال کردن سایر تغییرات و قابلیتهای این سرویس، میتوانید جدیدترین اخبار و آموزشهای ChatGPT را در مجله نکسینو مشاهده کنید.
سوالات متداول درباره GPT-Live
GPT-Live چیست؟
GPT-Live نسل سوم سیستم صوتی OpenAI است که میتواند همزمان صدای کاربر را دریافت و پاسخ صوتی تولید کند. این فناوری برای کاهش تأخیر و ایجاد مکالمهای طبیعیتر طراحی شده است.
آیا GPT-Live یک مدل مستقل هوش مصنوعی است؟
GPT-Live فقط یک مدل زبانی مستقل نیست؛ بلکه مجموعهای از مدل صوتی، زیرساخت انتقال صدا، مدیریت مکالمه و ارتباط با مدلهای قدرتمندتر OpenAI است.
تفاوت GPT-Live با Advanced Voice Mode چیست؟
Advanced Voice Mode تجربه صوتی قبلی ChatGPT بود. GPT-Live معماری جدیدتری دارد که مکالمه پیوسته، مدیریت بهتر قطع صحبت و پردازش همزمان صدا را ممکن میکند.
آیا GPT-Live میتواند همزمان گوش دهد و صحبت کند؟
بله. مدل صوتی GPT-Live بهصورت Full-Duplex طراحی شده است و میتواند همزمان صدای کاربر را دریافت و پاسخ صوتی پخش کند.
آیا GPT-Live برای همه کاربران ChatGPT فعال است؟
OpenAI اعلام کرده که زیرساخت GPT-Live در ChatGPT Voice استفاده میشود، اما جزئیات دسترسی آن ممکن است براساس نسخه، منطقه و نحوه انتشار قابلیتها متفاوت باشد.
GPT-Live API چه کاربردی دارد؟
توسعهدهندگان میتوانند با GPT-Live API دستیارهای صوتی، سیستمهای خدمات مشتریان، اپلیکیشنهای آموزشی و ایجنتهای مکالمهای بلادرنگ بسازند.