中文

揭示人类与 VLM 场景感知之间的差距:基于反事实语义显著性

计算机视觉与模式识别 2026-05-14 v1 人工智能

摘要

评估大型视觉语言模型(VLMs)是否与人类感知在高层语义场景理解方面保持一致,仍是一个挑战。传统的白盒可解释性方法不适用于封闭源体系结构,被动指标也无法隔离因果特征。我们引入了反事实语义显著性(CSS)。这是一个黑盒且模型中立的框架,通过衡量从场景中对对象进行因果消除所导致的语义偏移来量化对象的重要性。为评估 AI-人类语义对齐,我们将主流 VLMs 对抗人类心理物理学基准测试,基准测试包括 16,289 个有效响应,覆盖 307 个复杂自然场景和 1,306 个高保真反事实变体。我们的分析揭示了一种普遍的场景理解差距:相对于人类,模型表现出对大型对象的过度依赖(大小偏见)、对图像中心对象的依赖(中心偏见)以及对高显著性对象的依赖。相比之下,模型对场景中人物的依赖程度低于我们的 human 参与者。模型的大小偏见是解释模型-人类语义分歧变差的主要驱动因素。代码和数据将在 https://github.com/starsky77/Counterfactual-Semantic-Saliency 上提供。

关键词

引用

@article{arxiv.2605.13047,
  title  = {Revealing the Gap in Human and VLM Scene Perception through Counterfactual Semantic Saliency},
  author = {Ziqi Wen and Parsa Madinei and Miguel P. Eckstein},
  journal= {arXiv preprint arXiv:2605.13047},
  year   = {2026}
}