中文

用于歌唱合成音色的半监督学习

声音 2020-11-06 v1 机器学习 音频与语音处理

摘要

我们提出了一种半监督歌唱合成器,它能够仅从音频数据中学习新音色,无需任何诸如音素分割的标注。我们的系统是一个具有两个编码器(语言编码器和声学编码器)与一个(声学)解码器的编码器-解码器模型。第一步,使用带标注的多歌手数据集以监督方式训练系统。在此,我们确保两个编码器产生的嵌入相似,以便后续可使用声学或语言输入特征来运行模型。为以无监督方式学习新音色,预训练的声学编码器用于为目标歌手训练一个解码器。最后,在推理时,预训练的语言编码器与新音色的解码器一同使用,从语言输入生成声学特征。我们通过听辨测试评估我们的系统,并表明结果与等效监督方法所得结果相当。

关键词

引用

@article{arxiv.2011.02809,
  title  = {Semi-supervised Learning for Singing Synthesis Timbre},
  author = {Jordi Bonada and Merlijn Blaauw},
  journal= {arXiv preprint arXiv:2011.02809},
  year   = {2020}
}

备注

5 pages, 1 figure, submitted to ICASSP 2021