中文

FLY-TTS:快速、轻量级且高质量的端到端文本到语音合成

音频与语音处理 2024-07-02 v1 声音

摘要

尽管近期文本到语音合成研究在生成高质量语音方面取得了显著进展,但针对轻量级快速模型的研究仍有限。本文介绍 FLY-TTS,一个基于 VITS 的新型快速、轻量级且高质量语音合成系统。具体而言,1) 我们用能够生成傅里叶频谱系数并随后执行逆短时傅里叶变换以合成波形的 ConvNeXt 块取代解码器;2) 为压缩模型大小,我们在文本编码器和基于流的模型中引入分组参数共享机制;3) 我们进一步利用大规模预训练的 WavLM 模型进行对抗训练以提高合成质量。实验结果表明,我们的模型在 Intel Core i9 CPU 上实现了 0.0139 的实时因子,快 8.8 倍于基线 (0.1221),同时实现了 1.6 倍的参数压缩。客观和主观评估表明,FLY-TTS 的语音质量与强基线相当。

关键词

引用

@article{arxiv.2407.00753,
  title  = {FLY-TTS: Fast, Lightweight and High-Quality End-to-End Text-to-Speech Synthesis},
  author = {Yinlin Guo and Yening Lv and Jinqiao Dou and Yan Zhang and Yuehai Wang},
  journal= {arXiv preprint arXiv:2407.00753},
  year   = {2024}
}

备注

Accepted to Interspeech 2024. 5 pages, 1 figure