Logit-注意力发散:基于注意力引导校准的多图像检索位置偏差缓解
计算机视觉与模式识别
2026-05-13 v1
摘要
多模态大语言模型(MLLM)在多图像跨模态检索中表现出强大性能,但因位置偏差问题而受限,即预测结果主要受输入顺序影响而非语义相关性。通过经验分析,我们识别出一种称为Logit-注意力发散的现象:输出logit严重偏斜,而内部注意力图仍与相关视觉证据良好对齐。该现象揭示了现有logit级校准方法(如PriDe)的根本局限。基于此洞察,我们提出一种训练无关、基于注意力引导的去偏框架,利用内在注意力信号在推理阶段对实例进行层级校正,仅需最小校准集且计算开销极低。在MS-COCO基准测试中,我们的方法显著提升了置换不变性,实现最先进性能,准确率相较于基线提升超过40%。代码已公开 https://github.com/brightXian/LAD。
引用
@article{arxiv.2605.11591,
title = {Logit-Attention Divergence: Mitigating Position Bias in Multi-Image Retrieval via Attention-Guided Calibration},
author = {Mingtao Xian and Yifeng Yang and Qinying Gu and Xinbing Wang and Nanyang Ye},
journal= {arXiv preprint arXiv:2605.11591},
year = {2026}
}