WaveFit:一种基于不动点迭代的迭代式非自回归神经声码器
音频与语音处理
2022-10-04 v1 机器学习
声音
机器学习
摘要
去噪扩散概率模型(DDPMs)与生成对抗网络(GANs)是神经声码器中流行的生成模型。DDPMs与GANs可分别由迭代去噪框架与对抗训练来刻画。本研究提出一种名为 \textit{WaveFit} 的快速高质量神经声码器,其将GANs的精髓基于不动点迭代整合进类DDPM的迭代框架中。WaveFit对输入信号迭代去噪,并训练深度神经网络(DNN)以最小化由所有迭代的中间输出计算的对抗损失。主观(并排)听测显示,在自然度上人类自然语音与WaveFit以五次迭代合成的语音间无统计显著差异。此外,WaveFit的推理速度比WaveRNN快240倍以上。音频demo见 \url{google.github.io/df-conformer/wavefit/}。
引用
@article{arxiv.2210.01029,
title = {WaveFit: An Iterative and Non-autoregressive Neural Vocoder based on Fixed-Point Iteration},
author = {Yuma Koizumi and Kohei Yatabe and Heiga Zen and Michiel Bacchiani},
journal= {arXiv preprint arXiv:2210.01029},
year = {2022}
}
备注
Accepted to IEEE SLT 2022