超越视觉编码器:识别与缓解大型视觉语言模型中的空间偏差
计算机视觉与模式识别
2026-02-04 v2 计算与语言
摘要
大型视觉语言模型在广泛的多模态任务中取得了显著成功,但其对空间变化的鲁棒性仍未得到充分理解。在本工作中,我们对 LVLMs 的空间偏差进行了系统研究,考察了当相同的关键视觉信息被放置在图像中的不同位置时模型如何响应。通过受控的探测实验,我们观察到当前的 LVLMs 在这种空间偏移下经常产生不一致的输出,揭示了其语义理解中明显的空间偏差。进一步分析表明,这种偏差并非源于视觉编码器,而是源于视觉编码器与大型语言模型之间注意力机制的不匹配,这破坏了全局信息流。基于这一洞察,我们提出了自适应全局上下文注入(AGCI),这是一种将共享全局视觉上下文动态注入到每个图像 token 中的轻量级机制。AGCI 无需架构修改即可工作,通过增强图像 token 的语义可访问性来缓解空间偏差,同时保留模型的固有能力。大量实验表明,AGCI 不仅增强了 LVLMs 的空间鲁棒性,而且在各种下游任务和幻觉基准上也取得了强劲的性能。
引用
@article{arxiv.2509.21984,
title = {Beyond the Vision Encoder: Identifying and Mitigating Spatial Bias in Large Vision-Language Models},
author = {Yingjie Zhu and Xuefeng Bai and Kehai Chen and Yang Xiang and Youcheng Pan and Yongshuai Hou and Weili Guan and Jun Yu and Min Zhang},
journal= {arXiv preprint arXiv:2509.21984},
year = {2026}
}