将神经语音波形合成器迁移至乐器声音生成
音频与语音处理
2019-11-20 v2 声音
机器学习
摘要
近期的神经波形合成器如 WaveNet、WaveGlow 与神经源滤波(NSF)模型,尽管波形生成方法不同,但在语音合成中已展现出良好性能。语音与音乐音频合成技术之间的相似性,为探索将语音合成器应用于音乐领域的最佳方式提供了有趣途径。本工作比较了三种用于乐器声音生成的神经合成器在三种场景下的表现:在音乐数据上从头训练、从语音域零样本学习、以及从语音到音乐域基于微调的适配。一项大规模感知测试的结果表明,当三种合成器先在语音数据上预训练再在音乐数据上微调时性能提升,这表明语音数据的知识对音乐音频生成有用。在各合成器中,WaveGlow 在零样本学习中展现出最佳潜力,而 NSF 在其他场景中表现最佳,并能生成感知上接近自然音频的样本。
引用
@article{arxiv.1910.12381,
title = {Transferring neural speech waveform synthesizers to musical instrument sounds generation},
author = {Yi Zhao and Xin Wang and Lauri Juvela and Junichi Yamagishi},
journal= {arXiv preprint arXiv:1910.12381},
year = {2019}
}
备注
Submitted to ICASSP 2020