中文

EmotionThinker:基于韵律感知强化学习的可解释语音情感推理

声音 2026-03-17 v2

摘要

语音中的情感信息在多模态感知中扮演着独特角色。然而,当前的语音大语言模型(SpeechLLMs)与传统的语音情感识别(SER)系统类似,仍将情感理解视为一个简单的分类问题。这导致预测的可解释性有限,同时未能充分利用大语言模型的表达和推理能力。在本工作中,我们首次尝试通过强化学习(RL)将语音情感识别重新构建为一个深度推理问题。我们提出了 EmotionThinker,其设计目标是生成准确的情感预测,并辅以基于细粒度声学线索的可解释说明。为实现这一目标,我们首先构建了 EmotionCoT-35K,一个带有思维链标注和详细描述的情感推理数据集。其次,我们观察到当前的语音大语言模型表现出较弱的韵律感知能力,而韵律线索是解读情感的基本信号。为解决这一问题,我们开发了韵律增强的基础模型 EmotionThinker-Base,并证明韵律增强能够改善情感理解。第三,我们为强化学习引入了带有渐进信任感知推理奖励的分组相对策略优化(GRPO-PTR)。与仅依赖基于规则的结果奖励的标准 GRPO 不同,GRPO-PTR 逐步引入推理奖励,并利用反映推理与结果一致性的可信度权重动态调整该奖励,同时基于多维标准使用奖励模型评估整体推理质量。EmotionThinker 在情感准确性和解释质量方面均优于先前最先进的评估模型,推动了语音情感识别迈向可解释的多模态推理。项目页面:https://github.com/dingdongwang/EmotionThinker

关键词

引用

@article{arxiv.2601.15668,
  title  = {EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning},
  author = {Dingdong Wang and Shujie Liu and Tianhua Zhang and Youjun Chen and Jinyu Li and Helen Meng},
  journal= {arXiv preprint arXiv:2601.15668},
  year   = {2026}
}

备注

ICLR 2026 (Oral). Project page: https://github.com/dingdongwang/EmotionThinker