基于语言模型的文本转语音中的情感维度控制:跨越广泛的人类情感谱
音频与语音处理
2026-01-21 v3 计算与语言
声音
摘要
由于情感表达的固有复杂性以及现有情感标签的有限覆盖范围,情感文本转语音(TTS)系统难以捕捉人类情感的完整谱系。为了解决这一问题,我们提出了一种基于语言模型的 TTS 框架,能够合成涵盖广泛情感风格的语音。我们的方法允许用户在愉悦度、唤醒度和支配度(PAD)这三个连续维度上进行灵活控制。为实现这一点,我们训练了一个情感维度预测器,基于已有的心理学研究,将语音数据集中的离散情感标签映射到 PAD 空间。重要的是,虽然情感维度预测器利用了离散标签,但 TTS 框架本身在训练过程中并不需要显式的情感标签。客观和主观评估表明,与基线相比,我们的框架能有效生成更具表现力的情感风格,并提升了自然度与多样性。
引用
@article{arxiv.2409.16681,
title = {Emotional Dimension Control in Language Model-Based Text-to-Speech: Spanning a Broad Spectrum of Human Emotions},
author = {Kun Zhou and You Zhang and Dianwen Ng and Shengkui Zhao and Hao Wang and Bin Ma},
journal= {arXiv preprint arXiv:2409.16681},
year = {2026}
}
备注
ICASSP 2026