Learn2Sing:通过向歌唱教师学习实现目标说话人歌唱语音合成
声音
2020-11-18 v1 音频与语音处理
摘要
随着语音合成领域的快速发展,歌唱语音合成受到了越来越多的关注。通常,要从歌词和音乐相关转录生成自然的歌唱语音,往往需要录音室级别的歌唱语料库。然而,这类语料库难以收集,因为我们许多人很难像专业歌手那样演唱。在本文中,我们提出一种方法——Learn2Sing,该方法仅需一位歌唱教师即可生成目标说话人的歌唱语音,而无需他们的歌唱语音数据。在我们的方法中,一位教师的歌唱语料库和来自多个目标说话人的语音在一个帧级自回归声学模型中进行训练,其中歌唱和说话共享共同的说话人嵌入和风格标签嵌入。同时,由于目标说话人没有音乐相关转录,我们使用对数尺度基频(LF0)作为辅助特征作为声学模型的输入,以构建统一的输入表示。为了在推理阶段使目标说话人无需歌唱参考音频即可演唱,我们还训练了时长模型和 LF0 预测模型。特别地,我们在声学模型中采用域对抗训练(DAT),旨在通过从歌唱和说话数据的声学特征中解耦风格来增强目标说话人的歌唱表现。我们的实验表明,所提出的方法仅给定目标说话人的语音样本即可合成其歌唱语音。
引用
@article{arxiv.2011.08467,
title = {Learn2Sing: Target Speaker Singing Voice Synthesis by learning from a Singing Teacher},
author = {Heyang Xue and Shan Yang and Yi Lei and Lei Xie and Xiulin Li},
journal= {arXiv preprint arXiv:2011.08467},
year = {2020}
}
备注
8 pages, 3 figures