中文

基于音素级韵律控制的说唱-演唱语音合成

声音 2021-11-18 v1 计算与语言 机器学习 音频与语音处理

摘要

本文介绍了一种文本到说唱/演唱的系统,可适配任意说话人的声音。该系统利用基于 Tacotron 的多说话人声学模型,该模型仅在朗读语音数据上训练,并提供音素级韵律控制。同时研究了基于传统 DSP 算法的数据集增强与额外韵律操控。神经 TTS 模型在未见说话人的有限录音上微调,从而以目标说话人声音合成说唱/演唱。文中描述了系统的详细流程,包括从无伴奏歌曲中提取目标音高与时长值,并在合成前将其转换为目标说话人有效音域,以及通过 WSOLA 对输出进行额外韵律操控阶段以更好匹配目标时长值。合成语音可与伴奏音轨混合以生成完整歌曲。所提系统通过主观听测评估,并与同样旨在基于只读训练数据生成合成歌声的现有替代系统比较。结果表明,所提方法能生成自然度更高的高质量说唱/演唱语音。

关键词

引用

@article{arxiv.2111.09146,
  title  = {Rapping-Singing Voice Synthesis based on Phoneme-level Prosody Control},
  author = {Konstantinos Markopoulos and Nikolaos Ellinas and Alexandra Vioni and Myrsini Christidou and Panos Kakoulidis and Georgios Vamvoukakis and Georgia Maniati and June Sig Sung and Hyoungmin Park and Pirros Tsiakoulis and Aimilios Chalamandaris},
  journal= {arXiv preprint arXiv:2111.09146},
  year   = {2021}
}

备注

Proceedings of 11th ISCA Speech Synthesis Workshop (SSW 11)