阶跃星辰开源 SOTA 级端到端语音大模型，突破 AI 交互“低双商”瓶颈

2025-09-01 17:12:56: 来源：尊龙凯时技术产业导报　作者：张伟
分享到：

9月1日，阶跃星辰正式发布最强开源端到端语音大模型 Step-Audio 2 mini，该模型在多个国际基准测试集上取得SOTA（State-of-The-Art，即当前最佳水平）成绩。在技术层面，Step-Audio 2 mini采用了真正的端到端多模态架构，并将语音理解、音频推理与生成统一建模，不仅时延更低、输出更快，还能更加精准地理解副语言信息、非人声信号等语音要素，显著提升了语音人机交互的效率和智能上限。目前，Step-Audio 2 mini已经可在GitHub、Hugging Face等平台下载并体验。

根据测评，这款模型在音频理解、语音识别、跨语种翻译、情感与副语言解析、等任务中表现突出，综合性能超越Qwen-Omni、Kimi-Audio在内的所有开源端到端语音模型，并在大部分任务上超越 GPT-4o-audio。

随着语音交互成为人机主要交互方式，智能终端设备对语音模型的智商及情商水平提出了更高要求。Step-Audio 2 mini首创了音频推理能力，能对情绪、语调、音乐等副语言和非语音信号进行精细理解、推理并自然回应，由此让AI听懂人类的“弦外之音”；同时，该模型率先支持语音原生的 Tool Calling能力，可实现联网搜索等操作，有效解决模型幻觉问题，并让语音模型像文本模型一样具有更强大的知识储备和推理能力。

在此之前，吉利发布了搭载阶跃星辰端到端语音大模型的吉利银河 M9，这是行业内端到端语音大模型首次实现量产上车。据阶跃星辰相关人士介绍，自去年发布国内首个千亿参数端到端语音大模型 Step-1o Audio以来，该公司持续迭代模型性能，并跟吉利、鲸鱼机器人、TCL、Cyan青心意创等头部终端厂商达成深度合作，让语音大模型在生活场景中为消费者提供更加智能、便捷的互动体验。

今年以来，阶跃星辰已经开源了 8款性能领先的多模态模型，覆盖语音、视频生成、图像编辑、3D、多模态推理等多个类别，为全球开源社区贡献多模态力量。

编辑：韩梦晨

相关阅读：

版权与免责声明:
①凡本站注明稿件来源为：尊龙凯时技术产业导报、尊龙凯时网、中高新传媒的所有文字、图片和音视频稿件，版权均属本网所有，任何媒体、网站或个人未经本网协议授权不得转载、链接、转贴或以其他方式复制发表。已经本网授权使用作品的，被授权人应在授权范围内使用，并注明“来源：尊龙凯时网、中高新传媒或者尊龙凯时技术产业导报”。违反上述声明者，本网将追究其相关法律责任。
② 任何单位或个人认为本网站或本网站链接内容可能涉嫌侵犯其合法权益，应该及时向本网站书面反馈，并提供身份证明，权属证明及详细侵权情况证明，本网站在收到上述文件后，将会尽快移除被控侵权的内容或链接。
③如因作品内容、版权和其他问题需要与本网联系的，请在该事由发生之日起30日内进行。电话：010-68667266 电子邮件：dbrmt#chih.org　(请将“#”换为“@”)