视觉-语言模型中的目标定位机制
计算机视觉与模式识别
2026-05-20 v1
摘要
视觉-语言模型(VLMs)在连接视觉和文本信息方面非常有效,但它们常常在基本的分类和定位任务上表现不佳。虽然分类机制已得到更广泛的研究,但支持目标定位的过程仍然知之甚少。在这项工作中,我们使用一套机械可解释性工具,包括令牌消融、注意力剔除和因果中介分析,研究了两个代表性家族:LLaVA-1.5和InternVL-3.5。我们发现,定位是由一种容器化机制驱动的,其中与目标对齐的令牌定义了目标的空间范围,而这些边界内令牌的语义排列对预测框在很大程度上是无关的。只有极少数的注意力头对分类和定位的因果效应起中介作用,这些头集中在LLaVA的早中期层和InternVL的中后期层。这两个任务共享一些早期处理,但最终依赖于很大程度上不同的专门化注意力头。总的来说,我们首次提供了VLMs中定位的层级和注意力头级描述,揭示了狭窄的计算通路,可以指导未来的模型设计和视觉-语言对齐目标。
引用
@article{arxiv.2605.19792,
title = {Mechanisms of Object Localization in Vision-Language Models},
author = {Timothy Schaumlöffel and Martina G. Vilas and Gemma Roig},
journal= {arXiv preprint arXiv:2605.19792},
year = {2026}
}
备注
Accepted at CVPR 2026