对抗式音频合成
声音
2019-02-12 v3 机器学习
摘要
音频信号以高时间分辨率采样,学习合成音频需要捕捉跨越多个时间尺度的结构。生成对抗网络(GANs)在生成局部与全局一致的图像方面已取得广泛成功,但很少应用于音频生成。本文中我们引入 WaveGAN,首次尝试将 GANs 应用于原始波形音频的无监督合成。WaveGAN 能够合成具有全局一致性的秒级音频波形切片,适用于音效生成。我们的实验表明,在无标签情况下,WaveGAN 在小型词汇语音数据集上训练时能学会生成可理解的词语,也能合成其他领域音频如鼓声、鸟鸣与钢琴。我们将 WaveGAN 与一种将面向图像生成的 GANs 应用于类图像音频特征表示的方法进行比较,发现两种途径都很有前景。
引用
@article{arxiv.1802.04208,
title = {Adversarial Audio Synthesis},
author = {Chris Donahue and Julian McAuley and Miller Puckette},
journal= {arXiv preprint arXiv:1802.04208},
year = {2019}
}
备注
Published as a conference paper at ICLR 2019