中文

SoccerLens:超越准确率的足球视频视觉定位理解

计算机视觉与模式识别 2026-05-13 v2

摘要

视觉-语言模型(VLMs)近期在足球视频理解中展现出强大潜力。然而,由于视角变化大、镜头切换快以及场景杂乱,足球视频具有高度复杂性,目前尚不清楚 VLMs 是依赖有意义的视觉证据,还是利用了虚假相关性与捷径学习。现有评估协议主要关注分类准确率,而未评估视觉定位。为解决这一局限性,我们引入了 SoccerLens,一个用于视觉定位的足球视频理解基准。该基准包含跨越 1313 种常见足球事件的标注视频片段,其结构化视觉线索被组织为三个层次的语义相关性。我们进一步扩展了 Chefer [arXiv:2103.15679] 的归因方法,以联合建模空间与时间注意力,并引入了评估指标,用于衡量模型注意力是否与标注线索对齐或漂移至虚假区域。我们对最先进的足球 VLMs 的评估表明,尽管分类准确率很高,但即使在最宽松的线索定义下,当前模型的视觉定位性能也无法超过 50%50\%,且始终未充分利用时间信息。这些结果揭示了预测性能与真实视觉定位之间的巨大差距,突出了在足球等复杂时空领域中进行视觉定位评估的必要性。

关键词

引用

@article{arxiv.2605.09598,
  title  = {SoccerLens: Grounded Soccer Video Understanding Beyond Accuracy},
  author = {Ismael Elsharkawi and Ahmed Sait and Silvio Giancola and Bernard Ghanem and Hossam Sharara and Abdelrahman Eldesokey},
  journal= {arXiv preprint arXiv:2605.09598},
  year   = {2026}
}

备注

Preprint