语音合成中分层情感分布的多步预测与控制
声音
2025-07-08 v1 音频与语音处理
摘要
我们研究了分层情感分布(ED),以实现文本到语音合成(TTS)中情感渲染的多层级定量控制。我们引入了一个新颖的多步分层ED预测模块,该模块在语句、词和音素级别量化情感方差。通过多步方式预测情感方差,我们利用全局情感上下文来细化局部情感变化,从而捕捉语音情感的内在层次结构。我们的方法通过将其集成到方差适配器以及与各种TTS系统兼容的外部模块设计中得到验证。客观和主观评估均表明,所提出的框架显著增强了情感表现力,并能够在多个语音粒度上实现对情感渲染的精确控制。
引用
@article{arxiv.2507.04598,
title = {Multi-Step Prediction and Control of Hierarchical Emotion Distribution in Text-to-Speech Synthesis},
author = {Sho Inoue and Kun Zhou and Shuai Wang and Haizhou Li},
journal= {arXiv preprint arXiv:2507.04598},
year = {2025}
}
备注
Accepted to APSIPA Transactions on Signal and Information Processing