ResGrad:用于文本到语音的残差去噪扩散概率模型
音频与语音处理
2023-01-02 v1 计算与语言
机器学习
声音
信号处理
摘要
去噪扩散概率模型(DDPMs)因其在生成高保真样本方面的强大能力,正崭露于文本到语音(TTS)合成领域。然而,其在高维数据空间中的迭代细化过程导致推理速度缓慢,限制了它们在实时系统中的应用。已有工作尝试通过最小化推理步数来加速,但代价是样本质量下降。在本工作中,为在提升基于DDPM的TTS模型推理速度的同时实现高样本质量,我们提出ResGrad,一种轻量级扩散模型,它通过预测现有TTS模型(如FastSpeech 2)的输出谱图与相应真实语音之间的残差,来细化该模型的输出谱图。ResGrad具有若干优势:1)与其他需从零合成语音的DDPM加速方法相比,ResGrad将生成目标由真实mel谱图改为残差,降低了任务复杂度,从而模型更轻量、实时因子更小。2)ResGrad以即插即用的方式用于现有TTS模型的推理过程,无需重新训练该模型。我们在单说话人数据集LJSpeech以及两个更具挑战性的多说话人(LibriTTS)和高采样率(VCTK)数据集上验证了ResGrad。实验结果表明,相较于其他DDPM加速方法:1)在相同的以实时因子衡量的推理速度下,ResGrad取得了更好的样本质量;2)在相似语音质量下,ResGrad合成语音的速度比基线方法快10倍以上。音频样本见 https://resgrad1.github.io/。
引用
@article{arxiv.2212.14518,
title = {ResGrad: Residual Denoising Diffusion Probabilistic Models for Text to Speech},
author = {Zehua Chen and Yihan Wu and Yichong Leng and Jiawei Chen and Haohe Liu and Xu Tan and Yang Cui and Ke Wang and Lei He and Sheng Zhao and Jiang Bian and Danilo Mandic},
journal= {arXiv preprint arXiv:2212.14518},
year = {2023}
}
备注
13 pages, 5 figures