探讨视觉语言模型注意力头的功能角色:注意力模块的证据
人工智能
2025-12-12 v1
摘要
尽管在多模态基准测试中表现卓越,视觉语言模型(VLM)仍然是黑箱。本文提出一种新颖的可解释性框架,系统性地分析VLMs的内部机制,关注注意力头在多模态推理中的功能角色。为此,我们引入CogVision数据集,将复杂的多模态问题分解为逐步子问题,旨在通过链式思考范式模拟人类推理,每个子问题都与特定的感受或认知功能相关,如高级视觉感知和推理。使用探测方法,我们识别出专门于这些功能的注意力头,并将其刻画为功能性注意力头。我们在多样化的VLM家族中进行分析,发现这些功能性注意力头普遍稀疏,随功能而变化,其数量和分布在不同功能之间,且介导相互作用和层次组织。此外,干预实验表明它们在多模态推理中的关键作用:移除功能性注意力头会导致性能下降,而强化它们则提高准确率。这些发现为VLMs的认知组织提供了新见解,并为设计更符合人类感知和推理能力的模型指明了前景方向。
引用
@article{arxiv.2512.10300,
title = {Investigating The Functional Roles of Attention Heads in Vision Language Models: Evidence for Reasoning Modules},
author = {Yanbei Jiang and Xueqi Ma and Shu Liu and Sarah Monazam Erfani and Tongliang Liu and James Bailey and Jey Han Lau and Krista A. Ehinger},
journal= {arXiv preprint arXiv:2512.10300},
year = {2025}
}