中文

Spot The Ball:视觉社交推理基准

计算机视觉与模式识别 2025-11-20 v2 人机交互

摘要

人类在视觉社交推理方面表现出色,这是一种从细微的行为线索(如他人注视、姿态和方向)推断场景隐藏元素的能力。这种能力驱动了日常社交推理,也是开发更贴近人类智能体的关键。我们引入Spot The Ball,一个用于评估视觉社交推理在视觉语言模型(VLM)中的表现的挑战性基准测试,使用体育作为测试领域。该任务是从足球、篮球和排球图像中局化被移除的运动球。我们呈现了一个包含人类基线的精选评估集,以及可扩展生成其他测试项目的管道。我们评估了四种最先进的VLM(Gemini、GPT、LLaMA、Qwen),使用三种提示策略,发现人类在所有体育项目中始终比模型(≤17%)准确2-3倍(20-34%)。我们的分析表明,模型依赖浅层空间启发式——例如在图像中心或附近球员附近猜测——而人类则利用社交线索,如注视方向和身体姿态。这些发现揭示了视觉社交推理中持久的人类-模型差距,强调了需要显式编码结构化行为线索以实现稳健、贴近人类的推理的需求。

关键词

引用

@article{arxiv.2511.00261,
  title  = {Spot The Ball: A Benchmark for Visual Social Inference},
  author = {Neha Balamurugan and Sarah Wu and Adam Chun and Gabe Gaw and Cristobal Eyzaguirre and Tobias Gerstenberg},
  journal= {arXiv preprint arXiv:2511.00261},
  year   = {2025}
}