中文

视觉语言模型中单对象情境推断

计算机视觉与模式识别 2026-03-31 v1 人工智能

摘要

单个物体携带多少场景情境是人类场景感知中已研究的热点问题,但这种能力在视觉语言模型(VLM)中的组织方式尚不清楚,这直接影响这些模型的鲁棒性。我们通过系统性的行为与机制分析,研究从单个物体进行情境推断的能力。我们向VLM呈现带有遮蔽背景的单个物体,探测其在细粒度场景类别和粗粒度超级范畴(室内 vs. 户外)方面的情境推断能力。我们发现,单个物体在两个层次上都支持超过随机水平的推断,其表现受到与人类场景分类预测相同的物体属性调制。物体身份、场景和超级范畴预测在部分上是可解耦的:在一个层次上进行准确推断既不要求,也不保证在其他层次上进行准确推断,不同模型之间的耦合程度差异显著。在机制方面,保持稳定的物体表征(即即使移除背景情境也保持稳定)更能预测成功的情境推断。场景和超级范畴模式的 grounding 方式根本不同:场景身份在网络各层的图像标记中编码,而超级范畴信息仅在后期或根本不出现。综上,这些结果揭示了VLM中情境推断组织方式的复杂性,超出单纯的准确率所暗示的范围,包含行为和机制特征。

关键词

引用

@article{arxiv.2603.26731,
  title  = {Contextual inference from single objects in Vision-Language models},
  author = {Martina G. Vilas and Timothy Schaumlöffel and Gemma Roig},
  journal= {arXiv preprint arXiv:2603.26731},
  year   = {2026}
}