Sinsy:基于深度神经网络的歌声合成系统
音频与语音处理
2021-09-28 v1 计算与语言
机器学习
声音
摘要
本文介绍了 Sinsy,一个基于深度神经网络(DNN)的歌声合成(SVS)系统。近年来,DNN 已用于统计参数化 SVS 系统,且基于 DNN 的 SVS 系统已展现出优于传统基于隐马尔可夫模型系统的性能。SVS 系统需要合成严格遵循给定乐谱音高与节奏的歌声。此外,还应再现乐谱上未标注的演唱表达,如颤音与节奏波动。所提系统由四个模块组成:时间滞后模型、时长模型、声学模型与声码器,并可考虑这些歌声特征来合成歌声。为更好地建模歌声,所提系统在声学模型中引入了改进的 pitch 与 vibrato 建模方法以及更好的训练准则。此外,我们将 PeriodNet(一种对音高具有鲁棒性的非自回归神经声码器)纳入系统以生成高保真歌声波形。而且,我们提出了基于 DNN 的 SVS 自动音高校正技术,即使训练数据含有走调乐句也能合成音高正确的歌声。实验结果表明,我们的系统能合成具有更好节奏、更自然颤音及正确音高的歌声,并在主观评价测试中取得更好的平均意见得分。
引用
@article{arxiv.2108.02776,
title = {Sinsy: A Deep Neural Network-Based Singing Voice Synthesis System},
author = {Yukiya Hono and Kei Hashimoto and Keiichiro Oura and Yoshihiko Nankaku and Keiichi Tokuda},
journal= {arXiv preprint arXiv:2108.02776},
year = {2021}
}
备注
14 pages, 11 figures, 3 tables, Accepted to IEEE/ACM Transactions on Audio, Speech and Language Processing