中文

XiaoiceSing:高质量一体化歌唱语音合成系统

音频与语音处理 2020-06-12 v1 计算与语言 机器学习 声音

摘要

本文提出 XiaoiceSing,一个采用一体化网络进行频谱、F0 和时长建模的高质量歌唱语音合成系统。我们遵循 FastSpeech 的主要架构,同时提出一些歌唱特有的设计:1)除音素 ID 和位置编码外,还加入了来自乐谱的特征(如音高和音符长度)。2)为减轻跑调问题,我们在 F0 预测中添加了残差连接。3)除每个音素的时长损失外,还将一个音符内所有音素的时长累加以计算音节时长损失,从而增强节奏。实验结果表明,XiaoiceSing 在音质、发音准确度和自然度上分别比卷积神经网络基线系统高出 1.44、1.18 和 1.38 个 MOS。在两项 A/B 测试中,所提出的 F0 和时长建模方法相对于基线分别获得了 97.3% 和 84.3% 的偏好率,展示了 XiaoiceSing 的压倒性优势。

关键词

引用

@article{arxiv.2006.06261,
  title  = {XiaoiceSing: A High-Quality and Integrated Singing Voice Synthesis System},
  author = {Peiling Lu and Jie Wu and Jian Luan and Xu Tan and Li Zhou},
  journal= {arXiv preprint arXiv:2006.06261},
  year   = {2020}
}