中文

FlashSpeech:高效的零样本语音合成

音频与语音处理 2024-10-25 v4 人工智能 计算与语言 机器学习 声音

摘要

语言模型和扩散模型显著推进了大规模零样本语音合成的最新进展。然而,这两种方法的生成过程都缓慢且计算密集。使用更低的计算预算实现与先前工作相当的质量,仍然是高效语音合成面临的一项重大挑战。在本文中,我们提出了 FlashSpeech,一种大规模零样本语音合成系统,其推理时间约为先前工作的 5%。FlashSpeech 构建于潜在一致性模型之上,并应用了一种新颖的对抗一致性训练方法,该方法可以从头开始训练,而无需预训练的扩散模型作为教师模型。此外,新的韵律生成器模块增强了韵律的多样性,使语音的节奏听起来更自然。FlashSpeech 的生成过程可以通过一到两个采样步骤高效完成,同时保持高音频质量以及零样本语音生成中与音频提示的高相似度。我们的实验结果证明了 FlashSpeech 的优越性能。值得注意的是,FlashSpeech 的速度比其他零样本语音合成系统快约 20 倍,同时在音质和相似度方面保持相当的性能。此外,FlashSpeech 通过高效执行语音转换、语音编辑和多样化语音采样等任务展示了其多功能性。音频样本可在 https://flashspeech.github.io/ 获取。

关键词

引用

@article{arxiv.2404.14700,
  title  = {FlashSpeech: Efficient Zero-Shot Speech Synthesis},
  author = {Zhen Ye and Zeqian Ju and Haohe Liu and Xu Tan and Jianyi Chen and Yiwen Lu and Peiwen Sun and Jiahao Pan and Weizhen Bian and Shulin He and Wei Xue and Qifeng Liu and Yike Guo},
  journal= {arXiv preprint arXiv:2404.14700},
  year   = {2024}
}

备注

Efficient zero-shot speech synthesis