中文

表达性文本转语音中韵律表征的粒度研究

音频与语音处理 2023-02-13 v1 声音

摘要

在表达性语音合成中,广泛采用隐式韵律表征来处理训练过程中数据的变异性。同一文本可能对应多种声学实现,这在文本转语音中被称为一对多映射问题。在自编码框架下,从目标信号中提取语句级、词级或音素级表征,以补充音素输入并简化该映射。本文比较了不同粒度下的韵律嵌入,并考察了它们从文本中的预测情况。我们表明,语句级嵌入容量不足,而音素级嵌入在从文本预测时往往引入不稳定性。词级表征在容量与可预测性之间取得了平衡。结果,我们在 LibriTTS 数据集上将合成语音与录音在自然度上的差距缩小了 90%,且不牺牲可懂度。

关键词

引用

@article{arxiv.2301.11446,
  title  = {On granularity of prosodic representations in expressive text-to-speech},
  author = {Mikolaj Babianski and Kamil Pokora and Raahil Shah and Rafal Sienkiewicz and Daniel Korzekwa and Viacheslav Klimkov},
  journal= {arXiv preprint arXiv:2301.11446},
  year   = {2023}
}

备注

Accepted to IEEE SLT 2022