中文

TTS中富有表现力、可变且可控的时长建模

音频与语音处理 2022-06-29 v1 声音

摘要

随着非注意力神经文本转语音系统的兴起,时长建模再次成为一个重要的研究问题。当前的方法很大程度上退回到依赖先前的统计参数语音合成技术进行时长预测,这难以对语音中的表现力与多变性进行建模。本文提出两种改进时长建模的替代方法。首先,我们提出一种以短语结构为条件的时长模型,改进了预测时长并更好地对停顿进行建模。我们表明,以短语结构为条件的时长模型相比我们的基线时长模型提升了语音的自然度。其次,我们还提出一种称为Cauliflow的多说话人时长模型,该模型使用归一化流来预测更匹配复杂目标时长分布的时长。Cauliflow在自然度方面与我们提出的另一时长模型表现相当,同时为同一提示提供可变的时长与不同程度的表现力。最后,我们提出以参数为条件对Cauliflow进行约束,以一种新颖的方式对合成语音中的节奏与停顿提供直观控制。

关键词

引用

@article{arxiv.2206.14165,
  title  = {Expressive, Variable, and Controllable Duration Modelling in TTS},
  author = {Ammar Abbas and Thomas Merritt and Alexis Moinet and Sri Karlapati and Ewa Muszynska and Simon Slangen and Elia Gatti and Thomas Drugman},
  journal= {arXiv preprint arXiv:2206.14165},
  year   = {2022}
}

备注

Accepted to be published in the Proceedings of InterSpeech 2022