中文

基于VAW-GAN的非平行训练数据歌声转换

音频与语音处理 2020-11-04 v3 计算与语言 声音

摘要

歌声转换旨在不改变演唱内容的情况下将歌手的嗓音从源转换为目标。歌声转换系统的训练通常需要平行训练数据,但这在现实应用中并不实用。近期的编码器-解码器结构,如变分自编码Wasserstein生成对抗网络(VAW-GAN),提供了一种通过非平行训练数据学习映射的有效途径。在本文中,我们提出一种基于VAW-GAN的歌声转换框架。我们训练一个编码器从语音内容中解耦歌手身份与演唱韵律(F0轮廓)。通过以歌手身份和F0为条件,解码器生成具有未见目标歌手身份的输出谱特征,并改善F0渲染。实验结果表明,所提框架比基线框架取得更好的性能。

关键词

引用

@article{arxiv.2008.03992,
  title  = {VAW-GAN for Singing Voice Conversion with Non-parallel Training Data},
  author = {Junchen Lu and Kun Zhou and Berrak Sisman and Haizhou Li},
  journal= {arXiv preprint arXiv:2008.03992},
  year   = {2020}
}

备注

Accepted to APSIPA ASC 2020