EmoMM:在冲突与缺失情况下的多模态情感识别基准测试与引导
计算机视觉与模式识别
2026-05-05 v1 人工智能
摘要
多模态情感识别(MER)对于解释现实世界交互至关重要。虽然多模态大语言模型(MLLM)在 MER 方面显示出前景,但其在模态冲突和缺失情况下的内部决策机制仍 largely 未被探索。本文引入 EmoMM,一个包含模态对齐、冲突和缺失子集的全面基准测试,系统性地研究这些行为。通过广泛评估,我们发现 Video Contribution Collapse(VCC)现象,即 MLLM 因高令牌冗余和模态偏好而边缘化视频证据。为解决此问题,我们提出 Conflict-aware Head-level Attention Steering(CHASE),一种轻量级机制,检测模态冲突并在推理阶段进行注意力引导,有效缓解决策偏差且无需重新训练主干网络。实验结果表明,CHASE 在各种设置下均能显著提升性能,大幅增强 MLLM 在复杂情感情境中的可靠性。
引用
@article{arxiv.2605.01024,
title = {EmoMM: Benchmarking and Steering MLLM for Multimodal Emotion Recognition under Conflict and Missingness},
author = {Yueru Sun and Yimeng Zhang and Haoyu Gu and Nuo Chen and Dong She and Xianrong Yao and Yang Gao and Zhanpeng Jin},
journal= {arXiv preprint arXiv:2605.01024},
year = {2026}
}