中文

语音合成中分层情感分布的多步预测与控制

声音 2025-07-08 v1 音频与语音处理

摘要

我们研究了分层情感分布(ED),以实现文本到语音合成(TTS)中情感渲染的多层级定量控制。我们引入了一个新颖的多步分层ED预测模块,该模块在语句、词和音素级别量化情感方差。通过多步方式预测情感方差,我们利用全局情感上下文来细化局部情感变化,从而捕捉语音情感的内在层次结构。我们的方法通过将其集成到方差适配器以及与各种TTS系统兼容的外部模块设计中得到验证。客观和主观评估均表明,所提出的框架显著增强了情感表现力,并能够在多个语音粒度上实现对情感渲染的精确控制。

关键词

引用

@article{arxiv.2507.04598,
  title  = {Multi-Step Prediction and Control of Hierarchical Emotion Distribution in Text-to-Speech Synthesis},
  author = {Sho Inoue and Kun Zhou and Shuai Wang and Haizhou Li},
  journal= {arXiv preprint arXiv:2507.04598},
  year   = {2025}
}

备注

Accepted to APSIPA Transactions on Signal and Information Processing