ByteSing:使用时长分配编码器-解码器声学模型与 WaveRNN 声码器的中文歌声合成系统
音频与语音处理
2021-01-26 v2 声音
摘要
本文提出了 ByteSing,一个基于时长分配 Tacotron 类声学模型和 WaveRNN 神经声码器的中文歌声合成(SVS)系统。与传统的 SVS 模型不同,所提出的 ByteSing 采用 Tacotron 类编码器-解码器结构作为声学模型,其中分别探索了将 CBHG 模型和循环神经网络(RNN)作为编码器和解码器。同时,利用一个辅助音素时长预测模型来扩展输入序列,这可以增强模型的可控能力、模型稳定性和节拍预测精度。还采用 WaveRNN 神经声码器作为神经声码器,以进一步提高合成歌曲的音质。客观和主观实验结果均证明,本文提出的 SVS 方法能够通过提高音高和频谱预测精度来产生非常自然、富有表现力且高保真的歌曲,并且使用注意力机制的模型能够取得最佳性能。
引用
@article{arxiv.2004.11012,
title = {ByteSing: A Chinese Singing Voice Synthesis System Using Duration Allocated Encoder-Decoder Acoustic Models and WaveRNN Vocoders},
author = {Yu Gu and Xiang Yin and Yonghui Rao and Yuan Wan and Benlai Tang and Yang Zhang and Jitong Chen and Yuxuan Wang and Zejun Ma},
journal= {arXiv preprint arXiv:2004.11012},
year = {2021}
}
备注
Accepted by ISCSLP2021