中文

语义丰富性还是几何推理?探究视觉语言模型视觉不变性的脆弱性

计算机视觉与模式识别 2026-04-06 v2

摘要

本文探究了最新视觉语言模型(VLM)在基本几何变换下的根本脆弱性。虽然现代 VLM 在识别典型姿态下的物体或描述复杂场景等语义任务中表现出色,但在更基础的层面表现出系统性失效:缺乏可靠的空间不变性和等价性,以致难以在简单旋转、缩放和恒等变换下可靠确定物体身份。我们通过在多样化视觉领域(包括符号草图、自然摄影和抽象艺术)进行系统评估,展示了这一局限。随着语义内容变得稀疏,性能急剧下降,而这种行为在不同架构、模型容量和提示策略下均可观察。总体而言,我们的结果揭示了当前 VLM 在语义理解与空间推理之间的系统性差距,凸显了未来多模态系统需要更强几何 grounding 的需求。

关键词

引用

@article{arxiv.2604.01848,
  title  = {Semantic Richness or Geometric Reasoning? The Fragility of VLM's Visual Invariance},
  author = {Jason Qiu and Zachary Meurer and Xavier Thomas and Deepti Ghadiyaram},
  journal= {arXiv preprint arXiv:2604.01848},
  year   = {2026}
}