语义丰富性还是几何推理?探究视觉语言模型视觉不变性的脆弱性
计算机视觉与模式识别
2026-04-06 v2
摘要
本文探究了最新视觉语言模型(VLM)在基本几何变换下的根本脆弱性。虽然现代 VLM 在识别典型姿态下的物体或描述复杂场景等语义任务中表现出色,但在更基础的层面表现出系统性失效:缺乏可靠的空间不变性和等价性,以致难以在简单旋转、缩放和恒等变换下可靠确定物体身份。我们通过在多样化视觉领域(包括符号草图、自然摄影和抽象艺术)进行系统评估,展示了这一局限。随着语义内容变得稀疏,性能急剧下降,而这种行为在不同架构、模型容量和提示策略下均可观察。总体而言,我们的结果揭示了当前 VLM 在语义理解与空间推理之间的系统性差距,凸显了未来多模态系统需要更强几何 grounding 的需求。
引用
@article{arxiv.2604.01848,
title = {Semantic Richness or Geometric Reasoning? The Fragility of VLM's Visual Invariance},
author = {Jason Qiu and Zachary Meurer and Xavier Thomas and Deepti Ghadiyaram},
journal= {arXiv preprint arXiv:2604.01848},
year = {2026}
}