中文

基于 WaveNet 自编码器的乐音神经音频合成

机器学习 2017-04-06 v1 人工智能 声音

摘要

得益于算法的改进和高质量图像数据集的可用性,视觉领域的生成模型取得了快速进展。在本文中,我们在上述两个方面均做出了贡献,以促成音频建模领域的类似进展。首先,我们详细介绍了一种强大的新型 WaveNet 风格自编码器模型,该模型将自回归解码器以从原始音频波形中学习到的时间编码为条件。其次,我们引入了 NSynth,这是一个大规模且高质量的乐音数据集,其规模比现有的同类公开数据集大一个数量级。利用 NSynth,我们证明了 WaveNet 自编码器相较于经过良好调优的频谱自编码器基线,在定性和定量性能上均有提升。最后,我们表明该模型学习到的嵌入流形允许在乐器之间进行形变,在音色上进行有意义的插值,从而创造出逼真且富有表现力的全新声音类型。

关键词

引用

@article{arxiv.1704.01279,
  title  = {Neural Audio Synthesis of Musical Notes with WaveNet Autoencoders},
  author = {Jesse Engel and Cinjon Resnick and Adam Roberts and Sander Dieleman and Douglas Eck and Karen Simonyan and Mohammad Norouzi},
  journal= {arXiv preprint arXiv:1704.01279},
  year   = {2017}
}