中文

通过注意力分析探索多模态大语言模型中隐式视觉误理解

计算机视觉与模式识别 2025-05-26 v2

摘要

近期的进展提升了多模态大语言模型(MLLM)理解多图像信息的能力。然而,现有基准主要评估答案的正确性,忽略了模型是否真正理解视觉输入。为此,我们定义了隐式视觉误理解(IVM),即MLLM在未完全理解视觉输入的情况下仍提供正确答案。通过我们的分析,我们在因果注意力模块中解耦了视觉和文本模态,发现注意力分布随网络层数的加深而越来越集中于与正确答案相关联的图像。这一洞察导致我们引入了尺度无关的指标——注意力准确率(attention accuracy),以及用于量化IVM的新基准。注意力准确率直接通过内部机制评估模型的视觉理解,能够抵御位置偏差,提供更可靠的评估。此外,我们将方法扩展到更细的粒度,并在单模态场景中展示了其有效性,凸显了其在多样性和通用性方面的优势。

关键词

引用

@article{arxiv.2505.10541,
  title  = {Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis},
  author = {Pengfei Wang and Guohai Xu and Weinong Wang and Junjie Yang and Jie Lou and Yunhua Xue},
  journal= {arXiv preprint arXiv:2505.10541},
  year   = {2025}
}