阶跃星辰今日正式发布StepAudio3系列模型,包括StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen和StepAudio3Music,五款模型均已上线阶跃星辰开放平台,其中多款模型在Artificial Analysis榜单中位列全球第一。该系列覆盖真人级语音生成、完整音频生成、实时语音交互、复杂语音理解及音乐创作等场景。

其中,StepAudio3Realtime支持原生全双工实时对话,可同时理解语义、语气、情绪、副语言及环境声音,并支持推理与语音生成并行、Tool Call及长任务异步执行。在Artificial Analysis Conversational Dynamics榜单中综合得分98.9%,位列全球第一;语音推理准确率99.7%,同样排名全球第一。
StepAudio3ASR融合语音识别与大模型上下文理解能力,支持中文、英文、方言、中英混说、长音频及医疗、法律、金融等专业场景,WER仅1.7%,并列全球第一。StepAudio3TTS则强化音色、语调、节奏、停顿及笑声、迟疑、结巴等副语言表现,支持流式生成,面向实时语音交互。

此外,StepAudio3Gen可统一生成角色人声、音效、环境音和背景音乐,并支持多角色及声音时序控制;StepAudio3Music支持歌曲创作、清唱配乐、翻唱及基于ABC记谱法的多轮创作,可通过自然语言控制曲风、旋律、节奏、乐器和情绪。整体来看,StepAudio3正将语音模型能力从单一识别或生成拓展至完整音频内容生产与实时智能交互。