中文

AffectAgent:面向情感的多智能体检索增强式多模态情感识别

计算机视觉与模式识别 2026-04-15 v1

摘要

基于大语言模型的多模态情感识别依赖于静态参数记忆,常在解释细腻情感状态时出现幻觉。本文鉴于单轮检索增强式生成高度易受模态歧义影响,难以捕捉跨模态的复杂情感依赖,提出AffectAgent——一个面向情感的多智能体检索增强式生成框架,通过智能体间的协作决策实现细粒度情感理解。具体而言,AffectAgent由三个联合优化的专用智能体组成:查询规划器、证据过滤器和情感生成器,协作完成跨模态样本检索、证据评估与预测生成。这些智能体采用共享情感奖励的多智能体轨迹近端政策优化(MAPPO)进行端到端优化。进一步引入模态平衡混合专家(MB-MoE)和检索增强自适应融合(RAAF),其中MB-MoE动态调节不同模态的贡献以缓解因跨模态异质性导致的表示不匹配,而RAAF通过整合检索得到的音视觉嵌入,增强缺失模态情况下的语义完成。广泛的MER-UniBench实验表明,AffectAgent在复杂场景中取得优异性能。我们的代码将在https://github.com/Wz1h1NG/AffectAgent发布。

关键词

引用

@article{arxiv.2604.12735,
  title  = {AffectAgent: Collaborative Multi-Agent Reasoning for Retrieval-Augmented Multimodal Emotion Recognition},
  author = {Zeheng Wang and Zitong Yu and Yijie Zhu and Bo Zhao and Haochen Liang and Taorui Wang and Wei Xia and Jiayu Zhang and Zhishu Liu and Hui Ma and Fei Ma and Qi Tian},
  journal= {arXiv preprint arXiv:2604.12735},
  year   = {2026}
}