Matcha-TTS:一种基于条件流匹配的快速 TTS 架构
音频与语音处理
2024-01-11 v2 人机交互
机器学习
声音
摘要
我们介绍 Matcha-TTS,一种用于快速 TTS 声学建模的新型编码器-解码器架构,使用最优传输条件流匹配(OT-CFM)进行训练。这产生了一个基于 ODE 的解码器,能够以比使用分数匹配训练的模型更少的合成步数实现高输出质量。精心的设计选择还确保了每个合成步数的运行速度很快。该方法具有概率性、非自回归特性,并无需外部对齐即可从零开始学习说话。与强大的预训练基线模型相比,Matcha-TTS 系统具有最小的内存占用,在长语句上可与最快模型的速度相媲美,并在听测中获得最高平均意见分。请参见 https://shivammehta25.github.io/Matcha-TTS/ 获取音频示例、代码与预训练模型。
引用
@article{arxiv.2309.03199,
title = {Matcha-TTS: A fast TTS architecture with conditional flow matching},
author = {Shivam Mehta and Ruibo Tu and Jonas Beskow and Éva Székely and Gustav Eje Henter},
journal= {arXiv preprint arXiv:2309.03199},
year = {2024}
}
备注
5 pages, 3 figures. Final version, accepted to IEEE ICASSP 2024