无监督歌声转换
机器学习
2019-09-26 v3 声音
音频与语音处理
机器学习
摘要
我们提出了一种用于歌声转换的深度学习方法。所提出的网络不以文本或音符为条件,而是直接将一位歌手的音频转换为另一位歌手的声音。训练在没有任何形式监督的情况下进行:无歌词或任何类型的语音特征、无音符、歌手之间无匹配样本。所提出的网络对所有歌手采用单一的 CNN 编码器、单一的 WaveNet 解码器,以及一个强制潜在表示与歌手无关的 classifier。每位歌手由一个嵌入向量表示,解码器以该向量为条件。为了处理相对较小的数据集,我们提出了一种新的数据增强方案,以及基于回译(backtranslation)的新训练损失与协议。我们的评估表明,转换生成的歌声自然,且高度可辨识为目标歌手。
引用
@article{arxiv.1904.06590,
title = {Unsupervised Singing Voice Conversion},
author = {Eliya Nachmani and Lior Wolf},
journal= {arXiv preprint arXiv:1904.06590},
year = {2019}
}
备注
Accepted to Interspeech 2019