中文

MiniMax-Speech:基于可学习说话人编码器的内在零样文本到语音

音频与语音处理 2025-05-14 v1 声音

摘要

我们介绍MiniMax-Speech,这是一个基于自回归Transformer的文本到语音(Text-to-Speech, TTS)模型,能够生成高质量语音。其关键创新是可学习的说话人编码器,该编码器无需参考语音的转录即可从参考音频中提取音色特征。这使MiniMax-Speech能够以零样方式生成与参考在音色上高度一致且富有表现力的语音,同时支持以卓越的相似度进行单样本语音克隆。此外,通过提出的Flow-VAE,增强了合成音频的整体质量。该模型支持32种语言,在多个客观和主观评估指标上表现优异。值得注意的是,它在客观语音克隆指标(词错误率和说话人相似度)上实现了最先进(SOTA)结果,并在公开的TTS Arena排行榜中夺得第一。MiniMax-Speech的另一个关键优势得益于来自说话人编码器的稳健且解耦的表征,这使得在不修改基础模型的情况下实现可扩展,支持多种应用,包括:通过LoRA实现任意语音情感控制;将文本转换为语音(text-to-voice, T2V)通过直接从文本描述合成音色特征;以及通过微调音色特征实现专业语音克隆(professional voice cloning, PVC)。我们鼓励读者访问https://minimax-ai.github.io/tts_tech_report以获取更多示例。

关键词

引用

@article{arxiv.2505.07916,
  title  = {MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder},
  author = {Bowen Zhang and Congchao Guo and Geng Yang and Hang Yu and Haozhe Zhang and Heidi Lei and Jialong Mai and Junjie Yan and Kaiyue Yang and Mingqi Yang and Peikai Huang and Ruiyang Jin and Sitan Jiang and Weihua Cheng and Yawei Li and Yichen Xiao and Yiying Zhou and Yongmao Zhang and Yuan Lu and Yucen He},
  journal= {arXiv preprint arXiv:2505.07916},
  year   = {2025}
}