中文

DiffWave:一种用于音频合成的通用扩散模型

音频与语音处理 2021-04-01 v3 计算与语言 机器学习 声音 机器学习

摘要

在本工作中,我们提出 DiffWave,一种用于条件与非条件波形生成的通用扩散概率模型。该模型是非自回归的,并在合成时通过具有恒定步数的马尔可夫链将白噪声信号转换为结构化波形。它通过优化数据似然的一个变分界变体而高效训练。DiffWave 在多种波形生成任务中生成高保真音频,包括基于 mel 谱图条件的神经声码器、类别条件生成以及非条件生成。我们证明 DiffWave 在语音质量方面与强大的 WaveNet 声码器相当(MOS:4.44 对比 4.43),同时合成速度快几个数量级。特别地,在具有挑战性的非条件生成任务中,无论从各类自动还是人工评估来看,它在音频质量和样本多样性方面均显著优于自回归和基于 GAN 的波形模型。

关键词

引用

@article{arxiv.2009.09761,
  title  = {DiffWave: A Versatile Diffusion Model for Audio Synthesis},
  author = {Zhifeng Kong and Wei Ping and Jiaji Huang and Kexin Zhao and Bryan Catanzaro},
  journal= {arXiv preprint arXiv:2009.09761},
  year   = {2021}
}

备注

ICLR 2021 (oral)