中文

AffectGPT-R1:利用强化学习实现开放词汇多模态情感识别

人机交互 2026-02-10 v3

摘要

开放词汇多模态情感识别(OV-MER)旨在预测情感,无需受标签空间的限制,从而实现情感的细粒度理解。不同于传统判别方法,OV-MER利用生成模型捕获情感的完整谱系,并使用情感轮子(EWs)进行度量计算。以往方法(如AffectGPT)主要依赖token级损失进行训练。然而,这一目标与OV-MER所用的度量不吻合,而这些度量无法通过反向传播进行优化。为此,我们提出AffectGPT-R1,一种将EW基于度量作为奖励函数并应用策略优化以最大化该奖励的强化学习框架。此外,我们引入显式推理过程并检验其在OV-MER中的必要性。为进一步引导模型行为,我们纳入正则化情感推理和情感预测的辅助奖励。我们还应用长度惩罚以缓解奖励攻击。实验结果表明,AffectGPT-R1在OV-MER上显著提升了性能。此外,我们的方法增强了情感的泛化理解,在MER-UniBench上实现了最新的SOTA成绩。我们的代码已在补充材料中提供并将公开,以促进未来研究。

关键词

引用

@article{arxiv.2508.01318,
  title  = {AffectGPT-R1: Leveraging Reinforcement Learning for Open-Vocabulary Multimodal Emotion Recognition},
  author = {Zheng Lian and Fan Zhang and Yazhou Zhang and Jianhua Tao and Rui Liu and Haoyu Chen and Xiaobai Li and Bin He},
  journal= {arXiv preprint arXiv:2508.01318},
  year   = {2026}
}