中文

GANSynth: 对抗神经网络音频合成

声音 2019-04-16 v2 机器学习 音频与语音处理 机器学习

摘要

高效的音频合成是一个固有的困难机器学习任务,因为人类感知对全局结构和细粒度波形相干性都很敏感。自回归模型(如WaveNet)以牺牲全局潜在结构和缓慢的迭代采样为代价来建模局部结构,而生成对抗网络(GAN)具有全局潜在条件和高效的并行采样,但难以生成局部相干的音频波形。在此,我们证明GAN可以通过在频谱域中以足够的频率分辨率建模对数幅度和瞬时频率,从而生成高保真且局部相干的音频。通过在NSynth数据集上的广泛实证研究,我们证明GAN能够在自动和人工评估指标上超越强大的WaveNet基线,并且比自回归对应模型快几个数量级地高效生成音频。

关键词

引用

@article{arxiv.1902.08710,
  title  = {GANSynth: Adversarial Neural Audio Synthesis},
  author = {Jesse Engel and Kumar Krishna Agrawal and Shuo Chen and Ishaan Gulrajani and Chris Donahue and Adam Roberts},
  journal= {arXiv preprint arXiv:1902.08710},
  year   = {2019}
}

备注

Colab Notebook: http://goo.gl/magenta/gansynth-demo