微软正在进一步加强Foundry平台的实时语音能力,为开发者提供能够直接进行语音输入和语音输出的原生语音智能体,从而让企业能够更加容易地构建类似Google Gemini Live的实时对话式AI体验。

1790309180_microsoft_foundry_voice_agents.webp

微软此次更新的核心变化,是Foundry Agent Service开始支持原生实时语音能力。与传统AI智能体先将语音转换成文字、再交给文本模型处理、最后把文字重新转换成语音的流程不同,原生语音架构可以直接让实时语音模型处理用户的语音输入并生成语音回复,从而减少中间环节以及由此产生的延迟。

对于用户而言,这意味着AI智能体可以更加自然地进行连续对话。用户不需要先等待语音识别完成,也不必等到模型生成完整文字答案后再开始语音合成。系统能够更加接近人与人之间的实时交流方式,并能够处理打断、轮次判断等语音交互中的关键环节。

微软此次能力建立在Voice Live API之上。该接口将语音识别、生成式AI、文本转语音、轮次检测以及打断处理等功能整合到统一的实时语音接口中,使开发者无需分别搭建多个语音组件,就可以为自己的AI智能体增加实时语音交互能力。

对于已经使用Foundry Agent Service构建AI智能体的企业而言,这意味着原本基于文本的智能体可以进一步获得语音交互能力,同时继续使用原有的工具调用、知识库、记忆、内容安全防护以及企业级数据和服务集成能力。

微软特别强调,语音智能体并不只是一个能够“读出答案”的聊天机器人,而是能够在实时语音交流过程中调用工具并执行任务。例如企业可以利用这种技术打造客户服务系统,让用户直接通过电话与AI智能体交流;也可以用于无障碍服务、语音优先的应用以及各种需要自然语音交互的企业内部系统。

在技术架构方面,Foundry目前支持两种主要的语音智能体路线。其中一种是传统的语音流水线,将用户语音转换为文本,再交给文本模型进行推理,最后将生成的文本转换成语音。另一种则是此次重点强化的原生Speech-to-Speech,也就是语音到语音架构,由实时语音模型直接处理语音输入并生成语音输出。

原生语音架构的最大优势是降低延迟,同时能够更好地保持自然对话中的语气、停顿和交流节奏。对于需要连续交流的场景而言,这种方式相比传统“语音识别→文本模型→语音合成”的多阶段方案更加接近真正的实时对话。

微软还在持续完善Voice Live API的实时交互能力。近期更新加入了新的原生实时语音类型,并进一步改善回声消除、智能结束语检测以及并行工具调用等功能。其中回声消除尤其适合运行在自定义硬件或非标准音频链路上的语音智能体,可以让系统参考客户端实际播放的声音,从而减少AI听到自己声音后产生错误识别的问题。

除了语音本身,微软也在强化Foundry作为企业级AI智能体开发和运行平台的定位。Foundry Agent Service能够负责智能体的生命周期管理,并提供企业级安全、权限控制、网络隔离、运行追踪和评估等能力。这样一来,企业不需要从零开始搭建一套负责AI智能体运行、监控和语音通信的基础设施。

微软此举显然也瞄准了Google近年来不断强化的Gemini Live。Gemini Live已经成为Google面向消费者展示实时语音AI能力的重要产品,而微软则更强调将类似的实时语音能力直接提供给企业开发者,让公司可以基于自己的数据、工具和业务流程构建专属语音智能体。

两者的定位因此并不完全相同。Gemini Live主要面向普通用户提供直接可用的AI语音体验,而Microsoft Foundry则更偏向企业和开发者,重点在于让企业把实时语音能力嵌入客户服务、电话系统、内部业务以及其他专业应用之中。

微软近年来一直在推动AI智能体从简单的聊天机器人向能够自主执行任务的系统发展。随着语音能力加入这一体系,用户与智能体之间的交互方式也开始从键盘输入逐渐扩展到更加自然的实时对话。智能体不仅能够回答问题,还可以在对话过程中调用工具、访问企业数据并完成具体任务。

目前微软正在将Foundry Agent Service、Voice Live以及托管智能体等能力逐步整合到同一套企业AI平台中。随着这些技术成熟,企业构建实时语音客服、电话智能体、语音办公助手以及其他AI服务所需要自行开发和维护的基础设施将进一步减少。

这也意味着AI语音助手的竞争正在从单纯比较模型“会不会聊天”,转向比较谁能够提供更低延迟的语音交互、更完整的工具调用能力、更可靠的企业级基础设施以及更方便的开发环境。微软此次为Foundry加入原生实时语音智能体,正是其在企业AI市场进一步扩大语音智能体布局的重要一步。