表达性文本转语音中韵律表征的粒度研究
音频与语音处理
2023-02-13 v1 声音
摘要
在表达性语音合成中,广泛采用隐式韵律表征来处理训练过程中数据的变异性。同一文本可能对应多种声学实现,这在文本转语音中被称为一对多映射问题。在自编码框架下,从目标信号中提取语句级、词级或音素级表征,以补充音素输入并简化该映射。本文比较了不同粒度下的韵律嵌入,并考察了它们从文本中的预测情况。我们表明,语句级嵌入容量不足,而音素级嵌入在从文本预测时往往引入不稳定性。词级表征在容量与可预测性之间取得了平衡。结果,我们在 LibriTTS 数据集上将合成语音与录音在自然度上的差距缩小了 90%,且不牺牲可懂度。
引用
@article{arxiv.2301.11446,
title = {On granularity of prosodic representations in expressive text-to-speech},
author = {Mikolaj Babianski and Kamil Pokora and Raahil Shah and Rafal Sienkiewicz and Daniel Korzekwa and Viacheslav Klimkov},
journal= {arXiv preprint arXiv:2301.11446},
year = {2023}
}
备注
Accepted to IEEE SLT 2022