阶跃发布 StepAudio 3 系列语音大模型,拿下多个全球第一
阶跃于今日(9月15日)正式推出StepAudio 3系列模型,涵盖StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen以及StepAudio3Music五款产品。其中多款模型在Artificial Analysis榜单中斩获全球第一的成绩。目前,这五款模型已全部上线阶跃星辰开放平台。
官方表示,StepAudio 3系列分别针对以下核心应用场景设计:生成逼真的人声、生成完整的音频内容、实现实时语音交互、理解复杂场景下的语音,以及进行音乐创作。
以下是IT之家整理的模型官方详细介绍:
StepAudio 3 Realtime: 不仅仅是“能打断”,更能理解、思考并采取行动
当前,众多实时语音产品已具备全双工、打断及低延迟交互能力。真正拉开体验差距的关键,并非仅仅是“能否同时听和说”,而是模型能否在一场持续对话中,一边倾听一边理解,判断何时介入,同时完成推理与任务执行。
StepAudio 3 Realtime正是围绕这一目标,进一步提升了实时交互能力,支持原生全双工实时对话。
在Artificial Analysis的Conversational Dynamics榜单中,StepAudio 3 Realtime以98.9%的综合得分位居全球首位,展现了其在实时语音交互领域的领先地位。这意味着该模型不仅能“听懂”并“回答”,还能像真实交流中的人类一样把握对话节奏——懂得何时回应、何时等待,以及如何处理用户的临时打断和连续反馈。
此外,StepAudio 3 Realtime以99.7%的语音推理准确率,在Artificial Analysis的Speech Reasoning榜单中同样位列全球第一。Speech Reasoning基准测试专注于评估模型直接理解音频并完成复杂推理任务的能力,是业内衡量“原生语音模型”的权威第三方标准之一。
该模型还能同时解析语义、语气、情绪、副语言特征及环境声音,使得实时交互不再仅仅依赖文字内容,而是利用更完整的音频信息来理解用户意图。
面对复杂问题,StepAudio 3 Realtime支持推理与语音生成并行进行,在快速响应的同时,持续组织和深化后续答案。
不仅如此,Tool Call和长任务可异步执行,不会阻塞当前的语音会话。在任务运行期间,用户仍可继续交流,待结果完成后,再自然回归到当前对话上下文中。
这使得Realtime语音模型不仅能实现“更自然的聊天”,还能在同一场持续对话中,同时完成听、说、思考与行动。
StepAudio 3 ASR: 从听清字词,到理解含义
传统的语音识别主要解决“听到了什么”,但现实世界中的语音常包含方言、口音、专业术语、同音词及复杂的上下文信息。一个真正可用的ASR模型,不仅需要准确转写声音,还需理解说话者所表达的含义。
StepAudio 3 ASR将高精度语音识别与大型语言模型的上下文理解、知识及推理能力相结合,使语音识别从“辨认声音”进阶到“理解语境”。
它支持中文、英文、方言、中英混合、长音频以及专业领域等多种场景的识别,能适应不同的语言环境和表达方式。同时,借助大语言模型带来的知识理解能力,StepAudio 3 ASR能更准确地识别人名、地名、专业术语等复杂内容,在医疗、法律、金融、汽车、编程等领域提升专业表达的识别效果。
该模型还能处理低声、快语速、含糊连读、歌声及背景音乐等复杂输入,使真实声音环境下的语音能被更准确地识别和使用。
这意味着ASR模型不再仅仅是一个声音转写工具,而是能更精准地理解、检索和运用每一段语音内容。在会议纪要、视频字幕与直播理解、智能客服、车载交互、医疗记录、金融服务及专业内容生产等场景中,都能高效完成任务。
StepAudio 3 ASR在Artificial Analysis的非流式语音识别准确性榜单中,词错误率(WER)仅为1.7%,并列全球第一。
StepAudio 3 TTS: 不仅仅是朗读,更贴近真人表达
声音不仅承载文字信息,还包含语气、节奏、停顿及情绪等丰富的表达细节。如何让AI生成的语音更接近真实交流,一直是语音生成模型的重要研究方向。
StepAudio 3 TTS是一款面向实时交互场景、旨在生成真人级语音的模型,致力于让AI语音从“准确发声”走向“自然表达”。
该模型在音色基底、语调层次、节奏律动及气口停顿等方面,高度模仿人类自然口语模式。它不仅能为文字生成对应的语音,还能还原笑声、迟疑、结巴、重复、改口等真实交流中的副语言表现,使合成语音更接近真人说话。
同时,StepAudio 3 TTS能结合语义内容理解表达意图,自主调整情绪与语气变化,使声音表达更符合具体场景。在实时交互方面,该模型基于流式生成架构,实现生成与播放同步进行,满足实时语音应用的需求。
StepAudio 3 Gen: 人声、音效、环境音、音乐,一次生成
传统的音频内容生产流程往往冗长。角色配音、环境音、音效、背景音乐需要分别制作,再经过剪辑、对齐和混音,才能形成最终作品。
StepAudio 3 Gen尝试将这些分散的环节统一到一个模型中。
它可以根据自然语言描述和参考音频,统一生成人声、音效、环境音和背景音乐。用户只需描述角色、场景和剧情,无需针对特定角色或场景进行额外训练,即可直接生成具有完整声音层次的音频内容。
更重要的是,这些声音并非简单叠加。
StepAudio 3 Gen支持对多个角色的音色、说话方式、语气、情绪、方言口音,以及笑声、喘息、停顿等副语言特征进行精细控制,还可进一步指定对白、音效、环境声和背景音乐出现的时间与顺序。
这意味着,该模型不仅在“生成声音”,也开始参与整段内容的声音设计和时序编排。
对于影视、动画、游戏、广播剧、有声书和短视频创作者而言,原本需要素材搜集、多工具协作和大量后期处理的声音制作流程,有望被压缩到一次生成和持续迭代中。
StepAudio 3 Music: 不仅仅是生成,更参与创作
音乐生成模型已越来越擅长“一句话生成一首歌”。但真正的音乐创作,不应如此“简单抽卡”。创作者可能已有歌词、清唱、旋律、乐谱或Demo,希望AI能继续完成编曲、改编和制作。
因此,StepAudio 3 Music不仅支持从零生成,也支持基于ABC记谱法控制的多轮交互创作。
该模型支持歌曲创作、清唱配乐、歌曲翻唱等多种功能。用户可提供歌词、清唱、参考歌曲、ABC记谱法等多种输入,让模型围绕已有创作继续生成和完善作品。
同时,用户可通过自然语言直接控制曲风、人声、旋律、节奏、乐器、情绪、段落和制作质感。
该模型还对主歌、副歌、桥段、间奏等歌曲结构,以及跨段落的旋律发展、能量变化和演唱表达进行了建模,使生成目标不止是“一段好听的音乐”,而是一首结构完整、表达连贯的作品。
尤其在清唱配乐场景中,用户只需提供一段清唱,模型就能理解其中的旋律、节奏和情绪,并进一步补充和声、节奏、乐器和完整编曲。
一首温暖柔和的City Pop男声歌曲,带一点爵士和轻摇滚的感觉,氛围朦胧浪漫。
这使得音乐大模型开始更深入地融入真实的音乐生产流程,而不仅仅是一个“一键生成歌曲”的工具。