GPT-Live 通过全双工架构同时监听与表达,并可把搜索或深度推理委派给后台模型,让语音交互更连续。
发布了什么
OpenAI 于 2026 年 7 月 8 日发布 GPT-Live,并开始将其用于新版 ChatGPT Voice。与等待用户说完再响应的轮次式语音系统不同,GPT-Live 采用全双工架构,可以持续处理输入并生成输出,更灵活地决定倾听、回应、暂停或调用工具。
架构上的关键变化
GPT-Live 把自然、低延迟的语音交互与较重的搜索和推理任务分开。当问题需要更深入处理时,语音模型可以把任务委派给后台前沿模型,同时维持对话流程。这种分层设计兼顾交互流畅度与复杂任务能力。
应用前景与限制
连续语音有望改善语言练习、无障碍交互、实时客服和长时间协作体验。官方同时说明,部分语言仍可能存在口音或流利度差异,发布初期也不支持在同一新版语音体验中使用视频和屏幕共享。
语音 AI 的竞争焦点正从“能听懂并回答”转向是否能自然打断、持续倾听,并在后台完成更复杂的工作。
资料来源
内容版权归 SOSBEI 所有
