语音大模型 StepAudio 3 拿下三个世界第一,语音识别错误率只剩 1.7%
- 未分类
- 2小时前
- 6热度
- 0评论

1.7%。
这是 StepAudio 3 ASR 在 Artificial Analysis 非流式语音识别榜单上的词错误率,并列全球第一。什么概念?你随手念一段带人名、带术语、带方言的普通话,它一百个词里只错不到两个——这个水平已经贴着"比听写员还准"的线了。
9 月 15 日,阶跃一口气发布了五款语音大模型:Realtime、ASR、TTS、Gen、Music,覆盖从实时对话到音乐创作的全链路,全部上线阶跃星辰开放平台。按 InfoQ 的报道,其中多款在 Artificial Analysis 榜单位列全球第一。

挨个说人话版本:
Realtime:会等的语音对话
StepAudio 3 Realtime,实时语音对话模型。全双工——它可以一边听你说,一边判断什么时候该接话、什么时候继续等,你中途打断它也不尴尬。在 Artificial Analysis 对话动态榜拿 98.9% 的综合得分,全球第一;语音推理榜也是第一。

它还能在对话中理解语义、语气、情绪和环境声音,工具调用和长任务异步执行,任务跑着不打断聊天。
ASR 与 TTS:听得懂,说得像
StepAudio 3 ASR,就是开头那个 1.7%。亮点不在"听清",在"听懂":专业术语、人名地名、方言、中英混说,还有低声、语速快、背景带音乐这些糟心场景都做了优化。

StepAudio 3 TTS,合成语音。这次的看点是副语言——它能生成笑声、迟疑、重复、改口。就是真人说话时那些"嗯……那个……哈哈哈"的部分。流式架构下生成与播放同时进行。
Gen 与 Music:声音创作的流水线
StepAudio 3 Gen,把人声、音效、环境声、背景音乐合成一件事:你用自然语言描述角色、场景和剧情,它一次生成一段完整的音频,还能控制谁在几点开口、什么情绪。做广播剧、有声书、短视频配音的人应该已经开始搓手了。
StepAudio 3 Music,音乐创作。不只"一句话生成一首歌",支持清唱配乐、翻唱,还能用 ABC 记谱法跟它多轮来回改作品。
但我真正想聊的不是榜单,是它透露的方向变化。过去的语音模型在卷两件事:听得更清、说得更像人。StepAudio 3 这代把力气花在了三个新地方——
会"等"。全双工的核心不是抢答,是判断沉默该不该打破,像真人聊天里那个会听你把话说完的人。
会"分心"。它能在跟你聊天时异步执行任务和工具调用,比如你说"帮我订个会议室",它边聊边把这事办了,不打断对话。
会"不像 AI"。TTS 里那些迟疑、改口、笑声,恰恰是以前语音产品最想消灭的"瑕疵",现在成了还原真人的必需品。
从对讲机到聊天,语音交互的底层逻辑变了。
三条上手通道
一是开放平台 API。 https://platform.stepfun.com 上五款都已就位。价格给个参照(国际站定价文档: https://platform.stepfun.ai/docs/en/guides/pricing/details ):stepaudio-3-asr-max 是 0.24 美元一小时,上一代 stepaudio-2.5-asr 是 0.022 美元一小时——新代际贵一个量级,质量换钱,自己权衡。他们还有个 Step Plan 订阅制,能在 Claude Code、Cursor 这类工具里用订阅价调模型;7 月有过新用户 15 天免费体验的活动,现在已经截止了,现行动作以官网为准。
二是自己跑。stepfun-ai 这个 GitHub 组织一直有开源传统,Step-Audio 系列从 2025 年 2 月就开放权重了,魔搭上也能搜到系列模型;StepAudio 3 Gen 的技术报告和演示页都挂出来了。五款各自的开放程度,以仓库实际为准。
三是先白嫖个体验环境。GitHub 上有官方开源的 Step-Realtime-Console,实时语音的控制台前端,接上 API 就能自己搭一套调试环境,边玩边看参数。
【亲测补充:注册开放平台拿到免费额度后的实际调用截图;或本地部署的显存占用实测——发表前替换本段】
当然,说句公道话。榜单第一是第三方机构 Artificial Analysis 评的,官方转述听听就好,自己场景自己测才算数;Realtime 的"边聊边办事"听着美,真实延迟和任务成功率得压测过才有底;另外想本地跑语音大模型的话,显存门槛不低,别拿核显机器硬上。
· · ·
语音这条赛道,听得清早就不是瓶颈了,接得住话才算本事。

1.7% 是个句号,也是个逗号——听得清卷完了,接下来卷的是"像个人"。
你上一次被语音 AI 气到,是因为它没听清,还是因为它不会等?评论区聊聊。
这篇要是帮你省了调研时间,点个赞、点个在看,都是瞎聊,但希望对你有帮助。
常见问题
StepAudio 3 免费吗?
API 按量计费(ASR 旗舰款国际站 0.24 美元/小时),平台不定期有体验活动;Step-Audio 系列开源权重可本地部署,零 API 费但有显存门槛。
StepAudio 3 开源了吗?
Step-Audio 系列有开源传统(2025 年 2 月起),StepAudio 3 各款是否全量开放以 stepfun-ai 的 GitHub 仓库和魔搭为准。
和豆包、通义的语音比怎么样?
各家在不同评测维度各有胜负,本文只转述 Artificial Analysis 榜单结果,建议按自己的场景实测。
TTS 生成的语音能商用吗?
以阶跃开放平台的服务协议和各款模型的授权条款为准,商用前务必核对。
— 胡聊八道 · 都是瞎聊 —