中文

InferGrad:通过在训练中考虑推理过程改进声码器扩散模型

音频与语音处理 2022-02-10 v1 人工智能 计算与语言 机器学习 声音

摘要

去噪扩散概率模型(简称扩散模型)在推理中需要大量迭代才能达到与最先进生成模型相当或超越的生成质量,这不可避免地导致推理速度缓慢。以往方法旨在优化少量迭代下的推理调度以加速推理。然而,这导致生成质量下降,主要因为推理过程被单独优化,未与训练过程联合优化。本文提出 InferGrad,一种将推理过程纳入训练的声码器扩散模型,以在保持高生成质量的同时减少推理迭代次数。更具体地,在训练中,我们通过少量迭代下推理调度的反向过程从随机噪声生成数据,并施加损失以最小化生成样本与真实数据样本之间的差距。然后,与现有方法不同,InferGrad 的训练考虑了推理过程。在 LJSpeech 数据集上的实验证明了 InferGrad 的优势:在相同条件下,InferGrad 比基线 WaveGrad 语音质量更好,或在保持与基线相同语音质量的情况下实现 33 倍加速(InferGrad 为 22 次迭代,WaveGrad 为 66 次迭代)。

关键词

引用

@article{arxiv.2202.03751,
  title  = {InferGrad: Improving Diffusion Models for Vocoder by Considering Inference in Training},
  author = {Zehua Chen and Xu Tan and Ke Wang and Shifeng Pan and Danilo Mandic and Lei He and Sheng Zhao},
  journal= {arXiv preprint arXiv:2202.03751},
  year   = {2022}
}

备注

5 Pages, 2 figures. Accepted to ICASSP 2022