中文

更多图像,更多问题?多模态视觉语言模型失效模式的受控分析

计算机视觉与模式识别 2026-01-13 v1

摘要

大型视觉语言模型 (LVLMs) 已展现出惊人的能力,但其在理解和推理多个图像方面的熟练程度仍基本未被探索。虽然现有基准已启动对多图像模型的评估,但对其核心弱点及其原因的全面分析仍缺乏。本文引入 MIMIC (Multi-Image Model Insights and Challenges),一个新的基准,旨在严格评估 LVLMs 的多图像能力。使用 MIMIC,我们进行一系列诊断实验,揭示普遍问题:LVLMs 往往无法在图像之间聚合信息,或在同时跟踪/注意多个概念方面困难。为解决这些问题,我们提出两种新颖的互补补救措施。在数据侧,我们提出一种程序化数据生成策略,将单图像注释组合成丰富的、针对性的多图像训练示例。在优化侧,我们分析层级注意力模式,推导出针对多图像输入的注意力掩码方案。实验在跨图像聚合方面显著改善,同时也提升了现有多图像基准上的表现,在各种任务中超越了之前的最先进成果。数据和代码将在 https://github.com/anurag-198/MIMIC 上公开。

关键词

引用

@article{arxiv.2601.07812,
  title  = {More Images, More Problems? A Controlled Analysis of VLM Failure Modes},
  author = {Anurag Das and Adrian Bulat and Alberto Baldrati and Ioannis Maniadis Metaxas and Bernt Schiele and Georgios Tzimiropoulos and Brais Martinez},
  journal= {arXiv preprint arXiv:2601.07812},
  year   = {2026}
}

备注

19 pages, 16 figures