中文

无监督跨域歌声转换

音频与语音处理 2020-08-10 v1 机器学习 声音

摘要

我们提出了一种用于任意身份歌声转换任务的波形到波形生成模型。我们的方法利用为自动语音识别任务训练的声学模型,以及提取的旋律特征来驱动基于波形的生成器。所提出的生成架构对说话人身份不变,并且可以使用语音或歌唱源从无标签训练数据中训练生成目标歌手。该模型以端到端方式优化,无需任何人工监督,如歌词、音符或平行样本。所提方法为全卷积结构,可实时生成音频。实验表明,我们的方法显著优于基线方法,同时生成的音频样本比其它尝试更具说服力且更好。

关键词

引用

@article{arxiv.2008.02830,
  title  = {Unsupervised Cross-Domain Singing Voice Conversion},
  author = {Adam Polyak and Lior Wolf and Yossi Adi and Yaniv Taigman},
  journal= {arXiv preprint arXiv:2008.02830},
  year   = {2020}
}