中文

MelGAN:用于条件波形合成的生成对抗网络

音频与语音处理 2019-12-10 v3 计算与语言 机器学习 声音

摘要

先前工作(Donahue et al., 2018a; Engel et al., 2019a)发现用 GAN 生成连贯的原始音频波形颇具挑战。本文中,我们展示通过引入一组架构改变与简单训练技巧,可可靠地训练 GAN 生成高质量连贯波形。主观评价指标(平均意见得分,MOS)显示了所提方法在高质量 mel 谱图反演上的有效性。为确立所提技术的通用性,我们给出模型在语音合成、音乐域转换与无条件音乐合成中的定性结果。我们通过消融研究评估模型各组件,并提出一组设计用于条件序列合成任务的通用判别器与生成器的准则。我们的模型是非自回归、全卷积的,参数量显著少于竞争模型,并对未见说话人在 mel 谱图反演上具泛化能力。我们的 pytorch 实现在 GTX 1080Ti GPU 上以超过实时 100 倍速度运行,在 CPU 上超过实时 2 倍,无任何硬件特定优化技巧。

关键词

引用

@article{arxiv.1910.06711,
  title  = {MelGAN: Generative Adversarial Networks for Conditional Waveform Synthesis},
  author = {Kundan Kumar and Rithesh Kumar and Thibault de Boissiere and Lucas Gestin and Wei Zhen Teoh and Jose Sotelo and Alexandre de Brebisson and Yoshua Bengio and Aaron Courville},
  journal= {arXiv preprint arXiv:1910.06711},
  year   = {2019}
}