ComedicSpeech:低资源场景下脱口喜剧的文本到语音合成
声音
2023-05-23 v1 人工智能
音频与语音处理
摘要
文本到语音(TTS)模型能够生成自然且高质量的语音,但在合成具有戏剧表现力的语音(如脱口喜剧)时表现力不足。考虑到喜剧演员具有多样的个人语音风格,包括个人韵律、节奏和填充词,这需要真实世界的数据集和强大的语音风格建模能力,带来了挑战。在本文中,我们构建了一个新数据集并开发了ComedicSpeech,一种专为低资源场景下脱口喜剧合成定制的TTS系统。首先,我们通过韵律编码器提取韵律表征,并以灵活的方式将其作为条件注入TTS模型。其次,我们通过条件时长预测器增强个人节奏建模。第三,我们通过引入喜剧演员相关的特殊词符来建模个人填充词。实验表明,每位喜剧演员仅用十分钟训练数据,ComedicSpeech即比基线取得更好的表现力。音频样本可在 https://xh621.github.io/stand-up-comedy-demo/ 获取。
引用
@article{arxiv.2305.12200,
title = {ComedicSpeech: Text To Speech For Stand-up Comedies in Low-Resource Scenarios},
author = {Yuyue Wang and Huan Xiao and Yihan Wu and Ruihua Song},
journal= {arXiv preprint arXiv:2305.12200},
year = {2023}
}
备注
5 pages, 4 tables, 2 figure