中文

CM-TTS:通过加权采样器和一致性模型增强实时文本至语音合成效率

声音 2024-04-02 v1 计算与语言 音频与语音处理

摘要

神经文本至语音(TTS)系统在语音助手、电子学习和有声读物创作中有着广泛应用。对现代模型(如扩散模型(DMs))的追求为实现高保真、实时语音合成带来了希望。然而,扩散模型中多步采样的效率带来了挑战。已有研究尝试将 GAN 与 DMs 结合,通过近似去噪分布来加速推理,但由于对抗训练,这引入了模型收敛问题。为了克服这一点,我们引入了 CM-TTS,一种基于一致性模型(CMs)的新架构。受连续时间扩散模型启发,CM-TTS 在无需对抗训练或预训练模型依赖的情况下,以更少的步数实现了高质量的语音合成。我们进一步设计了加权采样器,以动态概率将不同的采样位置纳入模型训练,确保在整个训练过程中进行无偏学习。我们提出了一个实时梅尔频谱图生成一致性模型,并通过全面评估进行了验证。实验结果突显了 CM-TTS 相对于现有单步语音合成系统的优越性,代表了该领域的一项重大进展。

关键词

引用

@article{arxiv.2404.00569,
  title  = {CM-TTS: Enhancing Real Time Text-to-Speech Synthesis Efficiency through Weighted Samplers and Consistency Models},
  author = {Xiang Li and Fan Bu and Ambuj Mehrish and Yingting Li and Jiale Han and Bo Cheng and Soujanya Poria},
  journal= {arXiv preprint arXiv:2404.00569},
  year   = {2024}
}

备注

Accepted by Findings of NAACL 2024. Code is available at https://github.com/XiangLi2022/CM-TTS