中文

Matcha-TTS:一种基于条件流匹配的快速 TTS 架构

音频与语音处理 2024-01-11 v2 人机交互 机器学习 声音

摘要

我们介绍 Matcha-TTS,一种用于快速 TTS 声学建模的新型编码器-解码器架构,使用最优传输条件流匹配(OT-CFM)进行训练。这产生了一个基于 ODE 的解码器,能够以比使用分数匹配训练的模型更少的合成步数实现高输出质量。精心的设计选择还确保了每个合成步数的运行速度很快。该方法具有概率性、非自回归特性,并无需外部对齐即可从零开始学习说话。与强大的预训练基线模型相比,Matcha-TTS 系统具有最小的内存占用,在长语句上可与最快模型的速度相媲美,并在听测中获得最高平均意见分。请参见 https://shivammehta25.github.io/Matcha-TTS/ 获取音频示例、代码与预训练模型。

关键词

引用

@article{arxiv.2309.03199,
  title  = {Matcha-TTS: A fast TTS architecture with conditional flow matching},
  author = {Shivam Mehta and Ruibo Tu and Jonas Beskow and Éva Székely and Gustav Eje Henter},
  journal= {arXiv preprint arXiv:2309.03199},
  year   = {2024}
}

备注

5 pages, 3 figures. Final version, accepted to IEEE ICASSP 2024