视觉语言模型中空间推理的双重机制
计算机视觉与模式识别
2026-03-24 v1 机器学习
摘要
许多多模态任务,如图像描述和视觉问答,都需要视觉语言模型 (VLMs) 将对象与其属性及空间关系进行关联。然而,人们仍不清楚这些关联在VLMs内部的哪个位置以及如何计算。在本文中,我们展示,VLMs依赖两种并行的机制来表示这些关联。在语言模型主干中,中间层在对应于对象的视觉标记上表示内容无关的空间关系。然而,这一机制仅在塑造模型预测方面起次要作用。相反,空间信息的主要来源来自视觉编码器,其表示编码了对象的布局,并且直接被语言模型主干所利用。值得注意的是,这种空间信号在视觉标记上分布得很广, extending beyond object regions into surrounding background areas。我们表明,通过在所有图像标记上增强这些来自视觉的空间表示,可以提高在自然图像上的空间推理性能。总之,我们的结果阐明了VLMs内部如何计算空间关联,并突出了视觉编码器在实现空间推理中的核心作用。
引用
@article{arxiv.2603.22278,
title = {The Dual Mechanisms of Spatial Reasoning in Vision-Language Models},
author = {Kelly Cui and Nikhil Prakash and Ayush Raina and David Bau and Antonio Torralba and Tamar Rott Shaham},
journal= {arXiv preprint arXiv:2603.22278},
year = {2026}
}
备注
26 pages, 35 figures