RMSSinger:基于写实乐谱的歌唱语音合成
声音
2023-05-19 v1 计算与语言
音频与语音处理
摘要
我们关注一项具有挑战性的任务:基于写实乐谱的歌唱语音合成(RMS-SVS)。RMS-SVS 旨在给定带有不同音符类型(装饰音、连音符、休止符等)的写实乐谱时生成高质量歌声。尽管已取得显著进展,近期的歌唱语音合成(SVS)方法局限于细粒度乐谱,其需要复杂的数据收集流程及耗时的手动标注以对齐音符与音素。此外,这些手动标注破坏了乐谱中音符时值的规律性,使细粒度乐谱不利于作曲。为应对这些挑战,我们提出首个 RMS-SVS 方法 RMSSinger,其以写实乐谱为输入,省去了大部分繁琐的手动标注并避免了上述不便。注意到乐谱基于词而非音素,在 RMSSinger 中我们引入词级建模以避免耗时的音素时长标注与复杂的音素级 mel-音符对齐。此外,我们提出首个基于扩散的音高建模方法,改善了现有音高建模方法的自然度。为此,我们收集了一个包含写实乐谱及专业歌手依此演唱的歌声的新数据集。在该数据集上的大量实验证明了我们方法的有效性。音频样本见 https://rmssinger.github.io/。
引用
@article{arxiv.2305.10686,
title = {RMSSinger: Realistic-Music-Score based Singing Voice Synthesis},
author = {Jinzheng He and Jinglin Liu and Zhenhui Ye and Rongjie Huang and Chenye Cui and Huadai Liu and Zhou Zhao},
journal= {arXiv preprint arXiv:2305.10686},
year = {2023}
}
备注
Accepted by Finding of ACL2023