中文

将视觉语言模型推向球场:体育场景中空间智力基准测试

计算机视觉与模式识别 2026-03-11 v1

摘要

体育活动引发广泛关注,因为它们推动了人类身体与认知能力的极限。随着对视觉语言模型(VLM)中空间智力日益关注,体育为理解高强度人类运动与动态物体相互作用提供了自然的测试场。为此,我们提出了 CourtSI,即专为体育场景量身打造的首个大规模空间智力数据集。CourtSI 包含超过 100 万对 QA 对,依据系统化的分类法组织,涵盖空间计数、距离测量、定位和关系推理,涵盖代表性网球项目,包括羽毛球、网球和乒乓球。依据明确的球场几何作为度量锚点,我们开发了半自动数据引擎以重建体育场景,实现了 CourtSI 的可扩展策展。此外,我们引入 CourtSI-Bench,一个高质量的评估基准,包含 3,686 对 QA 对,并经过严格的人类验证。我们在 CourtSI-Bench 上评估了 25 个主流和开源 VLM,发现仍存在显著的人类-人工智能性能差距,以及现有空间智力基准测试的有限泛化能力。这些发现表明,体育场景暴露了现有基准测试捕捉空间智力能力的局限性。进一步地,在 CourtSI 上微调 Qwen3-VL-8B 可使 CourtSI-Bench 的准确率提升 23.5 个百分点。该适应模型也能有效泛化至 CourtSI-Ext,即一个基于相似但不可见体育项目构建的评估集,并显示出增强的空间感知解说生成能力。综上所述,CourtSI 为推动 VLM 在体育领域的空间智力提供了可扩展的路径。

关键词

引用

@article{arxiv.2603.09896,
  title  = {Stepping VLMs onto the Court: Benchmarking Spatial Intelligence in Sports},
  author = {Yuchen Yang and Yuqing Shao and Duxiu Huang and Linfeng Dong and Yifei Liu and Suixin Tang and Xiang Zhou and Yuanyuan Gao and Wei Wang and Yue Zhou and Xue Yang and Yanfeng Wang and Xiao Sun and Zhihang Zhong},
  journal= {arXiv preprint arXiv:2603.09896},
  year   = {2026}
}