MiniMax新一代语音模型登上国际权威评测榜单榜首

摘要：近日，来自上海的AI独角兽MiniMax稀宇极智发布新一代语音大模型Speech-02。该模型在国际最权威的两项语音评测榜单Artificial Analysis和Hugging Face TTS Arena 上，力压OpenAI、ElevenLabs等国际巨

IT时报记者毛宇

全球人工智能领域再次迎来中国时刻。

近日，来自上海的AI独角兽MiniMax稀宇极智发布新一代语音大模型Speech-02。该模型在国际最权威的两项语音评测榜单Artificial Analysis和Hugging Face TTS Arena 上，力压OpenAI、ElevenLabs等国际巨头，荣登双榜榜首，这一突破性进展意味着我国在AI语音生成领域已跻身世界领先行列。

就在今年年初，DeepSeek-R1以超低成本实现部分性能超越OpenAI o1的表现，打破了业界对硅谷大模型的“技术迷信”。此次MiniMax在语音AI领域的技术突破，再次证明了我国在大模型研发方面的强大实力。

国际权威语音评测榜单Artificial Analysis

Hugging Face TTS Arena 评测榜单

据介绍，Speech-02在语音模型核心技术指标：字错率WER和相似度SIM等客观指标上取得了SOTA（当前最佳技术）结果，用户盲听主观评价反馈也更自然、真实。

具体来看，与Seed-TTS、CosyVoice 2和真实音频相比，Speech-02在中英文的零样本语音克隆中均实现了更低的WER，表明其发音错误率更低且更清晰稳定。在SIM方面，Speech-02在所有24种测试语言中均显著优于ElevenLabs的multilingual_v2模型，前者生成的语音更逼近真人输出。

技术指标：字错率WER-越低越好、相似度SIM-越高越好

基于超强技术与足够泛化的模型能力，Speech-02为用户带来超拟人、个性化、多样性的语音服务。Speech-02通过“文生音”功能给定自然语言文本描述生成符合描述的音色；通过“声音参考”功能，对任意给定语音实现灵活控制，进行感情、语速、音高、语种等无缝切换；同时支持粤语、葡萄牙语、法语等32个语种，甚至在同一段语音里也可以实现多个语种间的自如切换。

值得关注的是，Speech-02性能登顶同时其商用定价仅为全球头部语音模型ElevenLabs的四分之一。目前，MiniMax已在文旅导览、金融服务、语音助手、AI教育等应用服务；AI玩具、教育学习机、汽车智能座舱等硬件场景形成成熟解决方案。

今年1月，MiniMax发布Speech-01语音模型，支持17种语言和上百种音色，快速在北美、英国、澳大利亚、日韩、意大利、巴西等20多个国家和地区实现落地合作。

“在海外，我们已支持大量内容创作者，通过低门槛的语音工具用自己的声音灵活接单，为广告、短片进行声音表演，赋能零工经济。”MiniMax海外生态负责人Linda介绍，“这次发布的Speech-02能够驾驭32个语种的不同口音和不同情绪，通过AI，通过对稀缺小语种的支持，未来多语种的声音将以当地最地道的发音传向全世界，帮助全球每一种语言都被听见、每一种文化都被理解”。

行业分析人士指出，这种“技术突破+商业落地”的双轮驱动模式，标志着我国人工智能产业已进入高质量发展新阶段。随着核心技术的持续突破和应用场景的不断拓展，国产大模型正在全球AI竞赛中跑出“中国速度”。

来源：IT时报一点号

标签：模型语音评测权威 minimax

本文地址：http://news.43b.com.cn/a/202785.html

免责声明：本站系转载，并不代表本网赞同其观点和对其真实性负责。如涉及作品内容、版权和其它问题，请在30日内与本站联系，我们将在第一时间删除内容!