阶跃星辰于9月15日正式发布了全新的 StepAudio3系列语音大模型。本次发布的模型矩阵包含StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen以及StepAudio3Music五款产品,并且多款模型在权威评测榜单 Artificial Analysis 中成功登顶全球第一。目前,这五款模型已在阶跃星辰开放平台全面上线,分别面向真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解及音乐创作这五大核心应用场景。
在实时交互领域,StepAudio3Realtime致力于实现全双工原生实时对话。它在 Artificial Analysis Conversational Dynamics 榜单中以98.9% 的综合得分夺得全球第一,在语音推理准确率上以99.7% 位列 Artificial Analysis Speech Reasoning 榜单全球第一。该模型不仅能够精准把握对话节奏、处理用户的临时打断与连续反馈,还支持语义、语气、情绪、副语言和环境声音的综合理解。此外,它支持推理与语音生成并行,工具调用(Tool Call)与长任务也能异步执行,确保语音会话不被阻塞。

在语音识别方面,StepAudio3ASR将高精度语音识别与大语言模型的知识推理能力深度融合,超越了传统的单纯声音转写。它支持中文、英文、方言、中英混说、长音频及专业领域等多种场景,在医疗、法律、金融、汽车和编程等专业领域表现优异,甚至能够轻松应对低声、快语速、含糊连读、歌声以及背景音乐等复杂输入环境。其非流式语音识别准确性的词错误率(WER)仅为1.7%,并列全球第一。
在语音生成方面,StepAudio3TTS是一款面向实时交互的真人级语音生成模型。它在音色基底、语调层次、节奏律动和气口停顿上完美贴合人类自然口语模式,不仅能够还原笑声、迟疑、结巴、重复和改口等副语言表现,还能根据语义内容自主调整情绪语气。配合流式生成架构,模型可以实现生成与播放的同步进行。
在音频内容综合生成上,StepAudio3Gen改变了传统音频需要多环节制作、剪辑和混音的冗长链路。用户只需通过自然语言描述和参考音频,就能一次性统一生成人声、音效、环境音和背景音乐。模型支持对角色音色、说话方式、情绪、方言及笑声等副语言特征进行精细控制,并能指定对白、音效和背景音乐出现的时间与顺序,直接参与整段内容的声音设计和时序编排。
在音乐创作领域,StepAudio3Music不仅支持从零生成,还支持基于 ABC 记谱法控制的多轮交互创作。用户可以通过歌词、清唱、参考歌曲或记谱法进行输入,并利用自然语言直接控制曲风、人声、旋律、节奏、乐器和情绪。模型对歌曲结构、跨段落旋律发展及能量变化进行了深度建模,尤其在清唱配乐场景中,只需一段清唱即可自动补充和声、节奏、乐器和完整编曲,真正深入到真实的音乐生产流程之中。