中文

MsEmoTTS:面向情感语音合成的多尺度情感迁移、预测与控制

声音 2022-01-19 v1 音频与语音处理

摘要

富有表现力的合成语音对于许多人机交互与音频广播场景至关重要,因此合成富有表现力的语音近年来备受关注。先前方法或通过显式标签、或通过从参考音频提取的固定长度风格嵌入来进行表现力语音合成,二者均只能学习平均风格,从而忽略了语音韵律的多尺度特性。本文提出 MsEmoTTS,一种多尺度情感语音合成框架,从不同层级建模情感。具体而言,所提方法为典型的基于注意力的序列到序列模型,并包含三个提出的模块:全局级情感呈现模块(GM)、语句级情感呈现模块(UM)与局部级情感呈现模块(LM),分别建模全局情感类别、语句级情感变化与音节级情感强度。除从不同层级建模情感外,所提方法还允许我们以不同方式合成情感语音,即从参考音频迁移情感、从输入文本预测情感,以及手动控制情感强度。在中文情感语音语料库上进行的大量实验表明,所提方法在情感迁移语音合成与基于文本的情感预测语音合成上分别优于所对比的基于参考音频与基于文本的情感语音合成方法。此外,实验也显示所提方法可灵活控制情感表达。详细分析显示了各模块的有效性及所提方法的良好设计。

关键词

引用

@article{arxiv.2201.06460,
  title  = {MsEmoTTS: Multi-scale emotion transfer, prediction, and control for emotional speech synthesis},
  author = {Yi Lei and Shan Yang and Xinsheng Wang and Lei Xie},
  journal= {arXiv preprint arXiv:2201.06460},
  year   = {2022}
}