用于条件波形合成的块自回归 GAN
音频与语音处理
2022-03-07 v2 声音
摘要
条件波形合成模型学习给定如文本、梅尔谱图或 MIDI 等条件时音频波形的分布。这些系统采用深度生成模型,通过顺序(自回归)或并行(非自回归)采样对波形建模。生成对抗网络(GAN)已成为非自回归波形合成的常见选择。然而,最先进的基于 GAN 的模型在执行梅尔谱图逆变换时会产生伪影。本文中,我们证明这些伪影对应于生成器无法学习准确的音高与周期性。我们表明,简单的音高与周期性条件相对于使用自回归而言,不足以减小该误差。我们讨论了自回归为学习瞬时频率与相位关系所提供的归纳偏置,并展示该归纳偏置即使在对每次前向传播中波形大块进行自回归采样时依然成立。相较于先前最先进的基于 GAN 的模型,我们提出的模型块自回归 GAN(CARGAN)将音高误差降低 40-60%,训练时间减少 58%,保持了适用于实时或交互式应用的快速生成速度,并维持或提升了主观质量。
引用
@article{arxiv.2110.10139,
title = {Chunked Autoregressive GAN for Conditional Waveform Synthesis},
author = {Max Morrison and Rithesh Kumar and Kundan Kumar and Prem Seetharaman and Aaron Courville and Yoshua Bengio},
journal= {arXiv preprint arXiv:2110.10139},
year = {2022}
}
备注
Published as a conference paper at ICLR 2022