探讨视觉语言模型中空间注意力偏差
计算机视觉与模式识别
2025-12-23 v1 计算与语言
摘要
视觉语言模型在理解视觉内容方面展现出惊人的能力,但其空间处理中的系统性偏差仍鲜有探讨。本工作识别并刻画了一种系统性空间注意力偏差,即在水平拼接的图像中,VLMs 在描述位置靠左的内容时通常优先于位置靠右的内容。通过对图像对进行的控制实验,使用开源和闭源模型均证明了这一偏差在不同架构中都持久存在。在中性提示条件下,模型约在97%的情况下优先描述位置靠左的内容。测试在阿拉伯语微调模型时发现,该偏差即使在右到左语言训练下仍然存在,排除了语言阅读方向为主要原因的可能性。调查来自 PixMo 和 Visual Genome 的标注指南,未发现明确的左优先排序指令,表明该偏差与架构因素而非显式的训练数据指令更为一致。这些发现揭示了当前 VLMs 处理空间信息的根本性局限。
引用
@article{arxiv.2512.18231,
title = {Investigating Spatial Attention Bias in Vision-Language Models},
author = {Aryan Chaudhary and Sanchit Goyal and Pratik Narang and Dhruv Kumar},
journal= {arXiv preprint arXiv:2512.18231},
year = {2025}
}