中文

用于改进复调音乐声音神经音频合成的条件变分自编码器

声音 2022-11-17 v1 机器学习 音频与语音处理

摘要

用于音频合成的深度生成模型近来取得显著改进。然而,对原始波形的建模仍是一项困难问题,尤其对于音频波形与音乐信号。最近,实时音频变分自编码器(RAVE)方法被开发用于高质量音频波形合成。RAVE 方法基于变分自编码器并利用两阶段训练策略。遗憾的是,RAVE 模型在再现宽音高复调音乐声音方面存在局限。因此,为增强重建性能,我们采用音高激活数据作为 RAVE 模型的辅助信息。为处理该辅助信息,我们提出了一种带条件变分自编码器结构及额外全连接层的增强 RAVE 模型。为评估所提结构,我们基于带隐藏参考与锚点的多刺激测试(MUSHRA)及 MAESTRO 进行了听音实验。所得结果表明,相比传统 RAVE 模型,所提模型展现出更显著的性能与稳定性提升。

关键词

引用

@article{arxiv.2211.08715,
  title  = {Conditional variational autoencoder to improve neural audio synthesis for polyphonic music sound},
  author = {Seokjin Lee and Minhan Kim and Seunghyeon Shin and Daeho Lee and Inseon Jang and Wootaek Lim},
  journal= {arXiv preprint arXiv:2211.08715},
  year   = {2022}
}

备注

5 pages, 6 figures