PriorGrad:利用数据依赖的自适应先验改进条件去噪扩散模型
机器学习
2022-02-22 v2 机器学习
声音
音频与语音处理
摘要
去噪扩散概率模型最近被提出,通过估计数据密度的梯度来生成高质量样本。该框架将先验噪声定义为标准高斯分布,而相应的数据分布可能比标准高斯分布更复杂,由于数据与先验之间的差异,这可能在将先验噪声去噪为数据样本时引入低效性。在本文中,我们提出 PriorGrad,通过基于条件信息从数据统计量导出自适应先验,来提高语音合成中条件扩散模型的效率(例如,以梅尔频谱图为条件的声码器)。我们制定了 PriorGrad 的训练和采样过程,并通过理论分析展示了自适应先验的优势。聚焦于语音合成领域,我们考虑了最近提出的基于频谱域和时域的扩散语音生成模型,并表明 PriorGrad 实现了更快的收敛和推理,具有更优的性能,带来了改进的感知质量和对更小网络容量的鲁棒性,从而证明了数据依赖自适应先验的效率。
引用
@article{arxiv.2106.06406,
title = {PriorGrad: Improving Conditional Denoising Diffusion Models with Data-Dependent Adaptive Prior},
author = {Sang-gil Lee and Heeseung Kim and Chaehun Shin and Xu Tan and Chang Liu and Qi Meng and Tao Qin and Wei Chen and Sungroh Yoon and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2106.06406},
year = {2022}
}
备注
ICLR 2022. 19 pages, 7 figures, 8 tables. Audio samples: https://speechresearch.github.io/priorgrad/