利用句子级条件控制的端到端语音合成说话速度控制
音频与语音处理
2020-08-14 v2 声音
摘要
本文提出一种可控的端到端文本到语音(TTS)系统,以句子级语速值作为附加输入来控制合成语音的说话速度(速度可控TTS;SCTTS)。所提系统采用语速值(输入音素数与输入语音长度之比)来控制说话速度。此外,通过采用基于全局风格标记的样式编码器,所提SCTTS系统能在保留音高等其他语音属性的同时控制说话速度。所提SCTTS不需要任何额外的训练良好模型或外部语音数据库来提取音素级时长信息,并可以端到端方式训练。另外,我们在快、正常与慢速语音上的听感测试表明,相较于其他以整句相同速率增减时长的音素时长控制方法,SCTTS能生成更自然的语音,尤其在慢速语音情形下。
引用
@article{arxiv.2007.15281,
title = {Speaking Speed Control of End-to-End Speech Synthesis using Sentence-Level Conditioning},
author = {Jae-Sung Bae and Hanbin Bae and Young-Sun Joo and Junmo Lee and Gyeong-Hoon Lee and Hoon-Young Cho},
journal= {arXiv preprint arXiv:2007.15281},
year = {2020}
}
备注
Accepted to INTERSPEECH 2020