基于PPG的对抗表示学习歌唱声音转换
声音
2020-10-29 v1 计算与语言
音频与语音处理
摘要
歌唱声音转换(SVC)旨在将一个歌手的声音转换为其他歌手的声音,同时保持演唱内容与旋律。在近期声音转换工作基础上,我们提出一种新颖模型,在保持稳定转换歌曲的同时保持其自然度与音调。我们构建了一个端到端架构,以音素后验图(PPGs)作为输入并生成梅尔频谱图。具体而言,我们实现了两个独立的编码器:一个将PPGs编码为内容,另一个压缩梅尔频谱图以提供声学与音乐信息。为提升在音色与旋律上的表现,我们为模型设计了一个对抗歌手混淆模块与一个梅尔回归表示学习模块。我们在自建的中文歌唱语料库上进行了客观与主观实验。与基线相比,我们的方法在自然度、旋律和声音相似度方面的转换性能均有显著提升。此外,我们的基于PPG的方法被证明对噪声源具有鲁棒性。
引用
@article{arxiv.2010.14804,
title = {PPG-based singing voice conversion with adversarial representation learning},
author = {Zhonghao Li and Benlai Tang and Xiang Yin and Yuan Wan and Ling Xu and Chen Shen and Zejun Ma},
journal= {arXiv preprint arXiv:2010.14804},
year = {2020}
}