更深思考,更弱准确:理解和缓解多模态大语言模型推理中的感知损伤
计算机视觉与模式识别
2026-05-21 v2 人工智能
摘要
多模态大语言模型 (MLLM) 在扩展推理模式下常常出现感知损伤,尤其是在视觉问答 (VQA) 任务中。我们识别注意力离散为根本原因:在多步推理期间,模型的视觉注意力变得分散,偏离与问题相关的区域,实际上“失去对视觉输入的关注”。为更好地理解这一现象,我们分析 MLLM 的注意力图,观察到推理提示显著降低了对关键区域注意力。我们进一步发现,模型对图像标记的整体注意力与其在图像内注意力空间分布之间的相关性很强。基于这一洞见,我们提出一种基于熵-聚焦准则挑选视觉头部并重新加权其注意力的训练无监督的视觉区域引导注意力 (VRGA) 框架,有效地将模型引导到推理期间关注问题相关区域。大量实验在视觉-语言基准测试上表明,我们的方法有效缓解了感知退化,导致视觉 grounding 与推理准确率提升,同时为理解 MLLM 如何处理视觉信息提供了可解释的洞见。
引用
@article{arxiv.2603.14184,
title = {Deeper Thought, Weaker Aim: Understanding and Mitigating Perceptual Impairment during Reasoning in Multimodal Large Language Models},
author = {Ruiying Peng and Xueyu Wu and Jing Lei and Lu Hou and Yuanzheng Ma and Xiaohui Li},
journal= {arXiv preprint arXiv:2603.14184},
year = {2026}
}