中文

从图像和文本学习的极限:视觉语言模型与具身场景理解

计算机视觉与模式识别 2026-03-30 v1

摘要

学习人类场景理解全部丰富性所需的信息是什么?分布假设认为,语言和图像的统计共现捕捉了视觉认知背后的概念知识。视觉语言模型(VLMs)在海量图文配对语料库上训练,但缺乏具身体验,使其成为检验分布假设的理想工具。我们报告了两项实验,将18个VLMs生成的描述与15个高级场景理解任务中超过2000名人类观察者的描述进行比较,任务涵盖常识知识、可供性、感官体验、情感反应和未来预测。由于许多任务缺乏真实答案,我们开发了人类校准余弦距离(HCD)指标,用于衡量VLM输出与人类响应分布的相似性,并按人类内部变异性进行缩放。在实验1中,VLMs在常识知识任务上接近人类水平表现,但在可供性任务上表现出稳健的缺陷,该缺陷不受提示工程影响,且随新型模型发布未得到改善。在实验2中,我们检验了六个解释可供性差距的机制假设,发现该缺陷是结构性的而非风格性的,且提供显式空间信息也无法解决。语料库分析显示,图像描述数据集包含稀疏的以主体为导向的可供性语言,这与Gricean理论关于具身知识为何在语言中被系统性低估的解释一致。综合来看,这些发现表明从图像和文本的分布学习不足以支持基于可供性的场景理解,暗示人类视觉认知的某些维度可能需要以主体为中心的、三维的体验,而照片或描述无法编码这种体验。

关键词

引用

@article{arxiv.2603.26589,
  title  = {The Limits of Learning from Pictures and Text: Vision-Language Models and Embodied Scene Understanding},
  author = {Gillian Rosenberg and Skylar Stadhard and Bruce C. Hansen and Michelle R. Greene},
  journal= {arXiv preprint arXiv:2603.26589},
  year   = {2026}
}

备注

7 figures, 5 tables