谷歌近日发布Gemini3.8Live和Gemini3.8Live Extended Thinking,新增近实时推理、语音与思考同步处理,以及后台工具和API调用能力。目前两款模型已陆续登陆Gemini API、Google AI Studio等开发者平台,并分别覆盖Search Live、Gemini Enterprise及Google Workspace、Gemini Live等场景。

两款模型的一项核心能力是支持AI在持续语音对话过程中后台执行工具和API调用,用户无需因网络搜索或任务执行暂停交流。模型还支持97种语言自动检测及对话中途切换、近实时视觉定位,并可在长时间思考任务中通过“让我检查一下……”等语言提示告知用户当前状态。
性能方面,Gemini3.8Live Extended Thinking在Artificial Analysis的Speech to Speech Quality Index中获得82.6分;Gemini3.8Live在Speech Agent Arena排名第二。Extended Thinking版本在T-Voice测试中得分68.6%,在Sierra T-Voice基准测试中为35.1%,Big Bench Audio测试达到97.7%。
此外,谷歌已与Agora、LiveKit、Vercel、Pipecat、Fishjam和Vision Agents等平台合作,方便开发者集成新模型。谷歌同时表示,两款模型生成的全部音频均嵌入不可见SynthID水印,用于识别AI生成音频。
此次升级进一步将实时语音交互从“听与说”扩展至理解、推理和任务执行,推动语音AI向持续、多任务的智能体交互形态发展。