中文

无监督歌声转换

机器学习 2019-09-26 v3 声音 音频与语音处理 机器学习

摘要

我们提出了一种用于歌声转换的深度学习方法。所提出的网络不以文本或音符为条件,而是直接将一位歌手的音频转换为另一位歌手的声音。训练在没有任何形式监督的情况下进行:无歌词或任何类型的语音特征、无音符、歌手之间无匹配样本。所提出的网络对所有歌手采用单一的 CNN 编码器、单一的 WaveNet 解码器,以及一个强制潜在表示与歌手无关的 classifier。每位歌手由一个嵌入向量表示,解码器以该向量为条件。为了处理相对较小的数据集,我们提出了一种新的数据增强方案,以及基于回译(backtranslation)的新训练损失与协议。我们的评估表明,转换生成的歌声自然,且高度可辨识为目标歌手。

关键词

引用

@article{arxiv.1904.06590,
  title  = {Unsupervised Singing Voice Conversion},
  author = {Eliya Nachmani and Lior Wolf},
  journal= {arXiv preprint arXiv:1904.06590},
  year   = {2019}
}

备注

Accepted to Interspeech 2019