中文

基于语言模型的文本转语音中的情感维度控制:跨越广泛的人类情感谱

音频与语音处理 2026-01-21 v3 计算与语言 声音

摘要

由于情感表达的固有复杂性以及现有情感标签的有限覆盖范围,情感文本转语音(TTS)系统难以捕捉人类情感的完整谱系。为了解决这一问题,我们提出了一种基于语言模型的 TTS 框架,能够合成涵盖广泛情感风格的语音。我们的方法允许用户在愉悦度、唤醒度和支配度(PAD)这三个连续维度上进行灵活控制。为实现这一点,我们训练了一个情感维度预测器,基于已有的心理学研究,将语音数据集中的离散情感标签映射到 PAD 空间。重要的是,虽然情感维度预测器利用了离散标签,但 TTS 框架本身在训练过程中并不需要显式的情感标签。客观和主观评估表明,与基线相比,我们的框架能有效生成更具表现力的情感风格,并提升了自然度与多样性。

关键词

引用

@article{arxiv.2409.16681,
  title  = {Emotional Dimension Control in Language Model-Based Text-to-Speech: Spanning a Broad Spectrum of Human Emotions},
  author = {Kun Zhou and You Zhang and Dianwen Ng and Shengkui Zhao and Hao Wang and Bin Ma},
  journal= {arXiv preprint arXiv:2409.16681},
  year   = {2026}
}

备注

ICASSP 2026