中文

DeepSinger:基于网络挖掘数据的歌声合成

音频与语音处理 2020-07-16 v2 计算与语言 声音

摘要

在本文中,我们开发了 DeepSinger,一个多语言、多歌手的歌声合成 (SVS) 系统,该系统从零开始使用从音乐网站挖掘的歌声训练数据构建。DeepSinger 的流程包括几个步骤:数据抓取、歌声与伴奏分离、歌词到歌声的对齐、数据过滤以及歌声建模。具体而言,我们设计了一个歌词到歌声的对齐模型,从粗粒度的句子级别到细粒度的音素级别自动提取歌词中每个音素的时长,并进一步基于前馈 Transformer 设计了一个多语言多歌手的歌声模型,直接从歌词生成线性频谱图,并使用 Griffin-Lim 合成声音。与以往的 SVS 系统相比,DeepSinger 具有以下优势:1)据我们所知,它是第一个直接从音乐网站挖掘训练数据的 SVS 系统;2)歌词到歌声的对齐模型进一步避免了任何人工对齐标注工作,大大降低了标注成本;3)基于前馈 Transformer 的歌声模型简单高效,去除了参数合成中复杂的声学特征建模,并利用参考编码器从嘈杂的歌声数据中捕获歌手的音色;4)它可以合成多种语言和多位歌手的歌声。我们在挖掘的歌声数据集上评估了 DeepSinger,该数据集包含来自 89 位歌手的约 92 小时数据,涵盖三种语言(中文、粤语和英语)。结果表明,仅使用从网络挖掘的歌声数据,DeepSinger 就能在音高准确性和声音自然度方面合成高质量的歌声(脚注:我们的音频样本见 https://speechresearch.github.io/deepsinger/)。

关键词

引用

@article{arxiv.2007.04590,
  title  = {DeepSinger: Singing Voice Synthesis with Data Mined From the Web},
  author = {Yi Ren and Xu Tan and Tao Qin and Jian Luan and Zhou Zhao and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:2007.04590},
  year   = {2020}
}

备注

Accepted by KDD2020 research track