语音合成中情感渲染的层级控制
声音
2025-06-24 v3 音频与语音处理
摘要
情感文本转语音合成(TTS)旨在从输入文本生成逼真的情感语音。然而,定量控制多层级情感渲染仍然具有挑战性。在本文中,我们提出了一个基于流匹配的情感 TTS 框架,并采用一种新颖的情感强度建模方法,以促进在音素、单词和句子层级上对情感渲染进行细粒度控制。我们引入了一个层级情感分布(ED)提取器,可在不同语音片段层级捕获可量化的 ED 嵌入。此外,我们探索了各种声学特征并评估了它们对情感强度建模的影响。在 TTS 训练期间,层级 ED 嵌入有效地从参考音频中捕获情感强度的变化,并将其与语言和说话人信息相关联。该 TTS 模型不仅在推理期间生成情感语音,还能定量控制语音各组成部分的情感渲染。客观和主观评估均证明了我们的框架在语音质量、情感表现力和层级情感控制方面的有效性。
引用
@article{arxiv.2412.12498,
title = {Hierarchical Control of Emotion Rendering in Speech Synthesis},
author = {Sho Inoue and Kun Zhou and Shuai Wang and Haizhou Li},
journal= {arXiv preprint arXiv:2412.12498},
year = {2025}
}
备注
Accepted to IEEE Transactions on Affective Computing