EMO-R3:面向多模态大语言模型的情感推理反射强化学习
人工智能
2026-03-02 v1 计算机视觉与模式识别
摘要
多模态大语言模型(MLLMs)在视觉推理和理解任务中取得显著进展,但仍难以捕捉人类情感的复杂性和主观性。现有基于监督微调的方法常因泛化性差和可解释性差,而强化学习方法如 Group Relative Policy Optimization 也未能与情感认知的内在特征一致。为此,我们提出 Reflective Reinforcement Learning for Emotional Reasoning(EMO-R3),旨�增强 MLLMs 的情感推理能力。具体而言,我们引入结构化情感思考(Structured Emotional Thinking)引导模型以结构化和可解释的方式进行情感推理步骤,并设计反思情感奖励(Reflective Emotional Reward),使模型能够基于视觉-文本一致性和情感连贯性对其推理进行重新评估。大量实验表明,EMO-R3 显著提升了 MLLMs 的可解释性和情感智能,实现了在多个视觉情感理解基准上的卓越性能。
引用
@article{arxiv.2602.23802,
title = {EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models},
author = {Yiyang Fang and Wenke Huang and Pei Fu and Yihao Yang and Kehua Su and Zhenbo Luo and Jian Luan and Mang Ye},
journal= {arXiv preprint arXiv:2602.23802},
year = {2026}
}
备注
Accepted by CVPR 2026