DiffGAN-TTS:基于去噪扩散 GAN 的高保真高效文本转语音
音频与语音处理
2022-01-31 v1 计算与语言
声音
摘要
去噪扩散概率模型(DDPMs)是具有表现力的生成模型,已被用于解决多种语音合成问题。然而,由于其较高的采样代价,DDPMs 难以用于实时语音处理应用。在本文中,我们提出 DiffGAN-TTS,一种新颖的基于 DDPM 的文本转语音(TTS)模型,可实现高保真且高效的语音合成。DiffGAN-TTS 基于去噪扩散生成对抗网络(GANs),其采用对抗训练得到的具有表现力的模型来近似去噪分布。我们通过多说话人 TTS 实验表明,DiffGAN-TTS 仅用 4 步去噪即可生成高保真语音样本。我们提出一种主动浅扩散机制以进一步加速推理。提出了一种两阶段训练方案,在第一阶段训练的基础 TTS 声学模型为第二阶段训练的 DDPM 提供有价值的先验信息。我们的实验表明,DiffGAN-TTS 仅用 1 步去噪即可达到高合成性能。
引用
@article{arxiv.2201.11972,
title = {DiffGAN-TTS: High-Fidelity and Efficient Text-to-Speech with Denoising Diffusion GANs},
author = {Songxiang Liu and Dan Su and Dong Yu},
journal= {arXiv preprint arXiv:2201.11972},
year = {2022}
}
备注
Preprint. 16 pages