中文

Grid2Matrix: 揭示视觉语言模型中的数字性遗忘症

计算机视觉与模式识别 2026-04-16 v2 人工智能

摘要

视觉语言模型 (VLMs) 在许多多模态推理基准测试中表现出色,但这些评估往往不要求对图像进行详尽的读取,因此可能掩盖其在忠实捕捉所有视觉细节方面的失败。我们引入 Grid2Matrix (G2M),一个受控基准测试,其中模型看到一个颜色网格和一个颜色到数字的映射,必须输出相应的矩阵。通过可变网格大小和颜色数量,G2M 提供了一种增加视觉复杂度而最小化语义干扰的简单方法。我们发现 VLMs 在零样本 end-to-end 评估中表现出尖锐的早期崩溃,失败于相当小的网格,而非随任务变得更密集而逐渐退化。我们探测了来自两个代表性家族的 VLMs 的视觉编码器,发现它们在对应 end-to-end 输出中保留了相当多的网格信息。这表明该失败并非仅由视觉编码解释,还反映了从视觉特征中可恢复的剩余信息与最终在语言中表达的之间的差距。我们称之为 \textit{Digital Agnosia}。进一步分析显示,这些错误高度结构化,强烈依赖网格单元如何与视觉 patch 边界重叠。我们也发现诸如模型规模和多模态对齐等常见策略并不完全消除这一失败模式。我们期待 G2M 作为理解 VLMs 在何处以及如何丢失细微视觉细节的有用基准,以及评估任务的测试平台,这类任务即使缺失少量视觉细节也会产生重大影响,如表格、图表、表单和 GUI。

关键词

引用

@article{arxiv.2604.09687,
  title  = {Grid2Matrix: Revealing Digital Agnosia in Vision-Language Models},
  author = {Yunkai Zhang and Linda Li and Yingxin Cui and Xiyuan Ruan and Zeyu Zheng and Kezhen Chen and Yi Zhang and Diji Yang},
  journal= {arXiv preprint arXiv:2604.09687},
  year   = {2026}
}