中文

透过他们的眼睛:评估视觉语言模型中的视觉观点采择能力

计算与语言 2024-09-23 v1 计算机视觉与模式识别 机器学习

摘要

视觉观点采择(VPT),即理解他人视角的能力,使个体能够预测他人的行动。例如,驾驶员可以通过评估行人看到什么来避免事故。人类通常在幼儿时期发展出这项技能,但目前尚不清楚最近兴起的视觉语言模型(VLM)是否具备这种能力。此外,随着这些模型越来越多地部署在现实世界中,理解它们如何执行像VPT这样细微的任务变得至关重要。本文引入了两个手动策划的数据集Isle-Bricks和Isle-Dots用于测试VPT技能,并利用它们评估了12个常用的VLM。在所有模型中,我们观察到当需要观点采择时,性能显著下降。此外,我们发现目标检测任务的性能与VPT任务的性能相关性很差,这表明现有的基准可能不足以理解这个问题。代码和数据集将在https://sites.google.com/view/perspective-taking提供。

关键词

引用

@article{arxiv.2409.12969,
  title  = {Seeing Through Their Eyes: Evaluating Visual Perspective Taking in Vision Language Models},
  author = {Gracjan Góral and Alicja Ziarko and Michal Nauman and Maciej Wołczyk},
  journal= {arXiv preprint arXiv:2409.12969},
  year   = {2024}
}