中文

缓解LVLMs多图像任务中跨图像信息泄漏

计算机视觉与模式识别 2025-08-20 v1 人工智能

摘要

大型视觉语言模型(LVLMs)在单图像任务上表现优异,但在处理多图像输入时性能显著下降。这一现象是由于来自不同图像的视觉线索在模型输出中被交织。我们称之为跨图像信息泄漏。为解决此问题,我们提出了FOCUS,这是一种无训练且无需修改网络结构的解码策略,旨在推断期缓解跨图像信息泄漏。FOCUS依次用随机噪声掩盖除单张干净图像之外的所有图像,引导模型聚焦于单张干净图像。我们在所有目标图像上重复此过程,以获取部分被掩盖上下文下的logits。然后,这些logits经过噪声-only参考输入的对比式校准,以抑制信息泄漏并获得更准确的输出。FOCUS在四个多图像基准测试和多种LVLM家族上 consistently 提供性能提升,表明FOCUS为无需额外训练或架构修改地提升多图像推理提供了通用且实用的解决方案。

关键词

引用

@article{arxiv.2508.13744,
  title  = {Mitigating Cross-Image Information Leakage in LVLMs for Multi-Image Tasks},
  author = {Yeji Park and Minyoung Lee and Sanghyuk Chun and Junsuk Choe},
  journal= {arXiv preprint arXiv:2508.13744},
  year   = {2025}
}

备注

Source code is available at https://github.com/yejipark-m/FOCUS