WeSinger:采用辅助损失与数据增强的歌唱语音合成系统
声音
2022-06-28 v5 计算与语言
音频与语音处理
机器学习
摘要
本文开发了一个名为WeSinger的新的多歌手中文神经歌唱语音合成(SVS)系统。为提升合成歌唱语音的准确性与自然度,我们设计了若干专用模块与技术:1)基于深度双向LSTM、带多尺度节奏损失与后处理步骤的时长模型;2)带有渐进式音高加权解码器损失的类Transformer声学模型;3)24 kHz音高感知LPCNet神经声码器以生成高质量歌唱波形;4)一种带多歌手预训练的新颖数据增强方法,以增强鲁棒性与自然度。据我们所知,WeSinger是首个同时采用24 kHz LPCNet与多歌手预训练的SVS系统。定量与定性评估结果均证明了WeSinger在准确性与自然度上的有效性,且WeSinger在近期公开中文歌唱语料Opencpop上取得了最先进的性能。部分合成歌唱样本可在线试听。
引用
@article{arxiv.2203.10750,
title = {WeSinger: Data-augmented Singing Voice Synthesis with Auxiliary Losses},
author = {Zewang Zhang and Yibin Zheng and Xinhui Li and Li Lu},
journal= {arXiv preprint arXiv:2203.10750},
year = {2022}
}
备注
accepted at InterSpeech2022