VLA 模型是否感知或回忆?通过经典视觉错觉探测视觉感知与记忆
计算机视觉与模式识别
2026-04-01 v3
摘要
大型视觉语言模型(VLA)常在原始图像上对经典视觉错觉作出“正确”的答案,但在错觉因素反转后仍坚持相同的响应,尽管人类对显而易见的视觉变化已感知。这引出一个根本性问题:VLA 是否感知视觉变化,或仅回忆记忆化模式?尽管已有多项研究指出了这一现象,但其背后的原因仍不清楚。为从观察结果转向系统性理解,本文引入 VI-Probe,一个可控的视觉错觉框架,具备分级扰动和匹配视觉控制(无错觉诱因),以分离视觉驱动的感知与语言驱动的回忆。不同于侧重平均准确率的 prior work,本文测量稳定性和灵敏度,计算 Polarity-Flip Consistency、Template Fixation Index 以及针对匹配控制的错觉乘子。跨不同家族的实验揭示,响应持久性源于异构原因而非单一机制。例如,GPT-5 表现出记忆覆盖,Claude-Opus-4.1 显示感知-记忆竞争,而 Qwen 系列则暗示视觉处理局限。我们的发现挑战了单一原因观点,动机是一种以测量控制视觉变化为导向的评估方法,既衡量知识又衡量对受控视觉变化的灵敏度。数据和代码均可在 https://sites.google.com/view/vi-probe/ 获取。
引用
@article{arxiv.2601.22150,
title = {Do VLMs Perceive or Recall? Probing Visual Perception vs. Memory with Classic Visual Illusions},
author = {Xiaoxiao Sun and Mingyang Li and Kun Yuan and Min Woo Sun and Mark Endo and Shengguang Wu and Changlin Li and Yuhui Zhang and Zeyu Wang and Serena Yeung-Levy},
journal= {arXiv preprint arXiv:2601.22150},
year = {2026}
}
备注
26 pages, 31 figures, 13 tables. Project Page: https://sites.google.com/view/vi-probe/