中文

识别和消除多图像视觉语言模型的位置偏差

计算机视觉与模式识别 2025-03-19 v1

摘要

大型视觉语言模型 (LVLMs) 的演进从单图像推理迈向多图像推理。尽管取得了这一进展,但我们的发现表明 LVLMs 在跨多个图像获取信息方面掌握得不够稳健,其预测结果受图像位置变化的显著影响。为进一步探索此问题,我们引入位置相关问答 (Position-wise Question Answering, PQA),以量化每个位置的推理能力。我们的分析显示,LVLMs 在位置偏差方面存在显著现象:开源模型在位置较后方的图像推理方面表现优异,但在位置较前方或中间的图像表现不佳;而专有模型在位置较前方和后方的图像理解方面表现改善,但在位置较中间的图像方面则表现较差。以此为动机,我们提出了简单且无需训练的 SoFa 注意力 (SoFA),通过在图像间因果注意力和双向注意力之间进行线性插值来消除此偏差。实验结果表明,SoFA 减少了位置偏差并提高了现有 LVLMs 的推理性能。

关键词

引用

@article{arxiv.2503.13792,
  title  = {Identifying and Mitigating Position Bias of Multi-image Vision-Language Models},
  author = {Xinyu Tian and Shu Zou and Zhaoyuan Yang and Jing Zhang},
  journal= {arXiv preprint arXiv:2503.13792},
  year   = {2025}
}

备注

Accepted to CVPR2025