中文

IndexTTS:一个工业级可控且高效的零样文本到语音系统

声音 2025-02-11 v1 人工智能 音频与语音处理

摘要

最近,基于大型语言模型(LLM)的文本到语音(TTS)系统因其高自然性和强大的零样本语音克隆能力而逐渐成为行业主流。本文介绍了 IndexTTS 系统,主要基于 XTTS 和 Tortoise 模型。我们添加了一些新颖的改进。具体而言,在中文场景中,我们采用结合字符和拼音的混合建模方法,实现对多音字和长尾字发音的可控性。我们还对比�了基于向量量化(VQ)与有限标量量化(FSQ)在语音音标记码book利用方面的效果。为进一步提升语音克隆效果和稳定性,我们引入了基于 Conformer 的 speech conditional encoder,并将 speechcode decoder 替换为 BigVGAN2。与 XTTS 相比,IndexTTS 在自然度、内容一致性和零样本语音克隆方面取得了显著提升。就流行的开源 TTS 系统(如 Fish-Speech、CosyVoice2、FireRedTTS 和 F5-TTS)而言,IndexTTS 具有更简洁的训练流程、更可控的使用方式以及更快的推理速度。此外,其性能超过这些系统。我们的演示可在 https://index-tts.github.io 查看。

关键词

引用

@article{arxiv.2502.05512,
  title  = {IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System},
  author = {Wei Deng and Siyi Zhou and Jingchen Shu and Jinchao Wang and Lu Wang},
  journal= {arXiv preprint arXiv:2502.05512},
  year   = {2025}
}