OpenAI 近日宣布,将目前用于 ChatGPT 语音功能的 GPT-Live-1 正式开放给开发者使用。开发者现在可以通过 API 把这一语音模型集成到自己的应用和业务流程中,构建能够实时听取用户讲话、同时进行回应的全双工语音助手。该模型的语音前端价格为每分钟 0.05 美元,后台用于复杂推理的模型则需按相应模型价格另行计费。

image.png

边听边说,打断与停顿都能自然处理

GPT-Live-1 是 OpenAI 今年推出的新一代实时语音模型,最大特点是采用全双工架构。传统语音 AI 通常依次完成语音识别、语言模型推理和语音合成三个步骤,用户说完话系统才能处理并生成回答;而 GPT-Live-1 能在听取用户讲话的同时生成语音输出,因此可更自然地处理打断、停顿、附和以及快速的来回对话,还能判断何时该继续说话、暂停、倾听或调用工具。

OpenAI 表示,这种架构明显降低了语音交互延迟,解决了传统流水线容易出现的衔接问题,开发者无需再自行协调多个独立模型之间的复杂切换。测试中,GPT-Live-1 在 Full Duplex Bench 上比 GPT-Realtime-2.1 高出 30 个百分点,尤其在轮流发言延迟与交互行为方面提升明显;与 GPT-6 Astra 以中等推理强度配合时,在评估端到端语音智能体任务的 Tau3 测试中也取得第一名。

复杂推理交给后台模型,成本可按需组合

GPT-Live-1 并不负责所有复杂推理。OpenAI 将负责实时听说交互的语音模型与负责深度推理的后台模型分离:当用户提出需要搜索、复杂分析或较长任务的问题时,GPT-Live-1 会把工作交给后台模型,同时继续维持自然语音交流。开发者因此可按业务选择后台模型——简单任务用更快更便宜的模型,复杂问题交给更强的推理模型。

应用方面,GPT-Live-1 原生支持电话场景,可用于餐厅预约、客户支持等全双工语音智能体。早期案例中,语言学习平台 Speak 发现,相比此前基于轮次的系统,GPT-Live-1 使系统主动打断学习者的情况减少接近 80%。模型还提供原生语音识别转写与响应文本,支持关键词偏置、轮次检测,并针对嘈杂环境做了优化;OpenAI 同时扩大了可用声音,覆盖更丰富的口音、方言和语言。开发者还可将 GPT-Live-1 与 Codex 等工具结合,由语音模型接收任务、后台工具处理,再回到语音对话。