中文

利用 BERT 导出语义信息提升歌唱语音合成表现力

声音 2023-09-01 v1 人工智能 音频与语音处理

摘要

本文提出一种端到端高质量歌唱语音合成(SVS)系统,其利用来自 Transformers 的双向编码器表示(BERT)导出的语义嵌入来提升合成歌唱语音的表现力。基于近期提出的 VISinger 主体架构,我们针对表现力歌唱语音合成提出了若干具体设计。首先,与先前 SVS 模型不同,我们使用从预训练 BERT 提取的歌词文本表示作为模型的额外输入。该表示包含歌词语义信息,可帮助 SVS 系统生成更具表现力与自然度的语音。其次,我们进一步引入能量预测器以稳定合成语音并建模更宽范围的能量变化,这也贡献于歌唱语音的表现力。最后但同样重要地,为减轻跑调问题,重新设计了音高预测器以预测真实音高与音符音高之比。客观与主观实验结果均表明,所提 SVS 系统可生成优于 VISinger 的更高质量歌唱语音。

关键词

引用

@article{arxiv.2308.16836,
  title  = {Towards Improving the Expressiveness of Singing Voice Synthesis with BERT Derived Semantic Information},
  author = {Shaohuan Zhou and Shun Lei and Weiya You and Deyi Tuo and Yuren You and Zhiyong Wu and Shiyin Kang and Helen Meng},
  journal= {arXiv preprint arXiv:2308.16836},
  year   = {2023}
}