SoccerLens:超越准确率的足球视频视觉定位理解
计算机视觉与模式识别
2026-05-13 v2
摘要
视觉-语言模型(VLMs)近期在足球视频理解中展现出强大潜力。然而,由于视角变化大、镜头切换快以及场景杂乱,足球视频具有高度复杂性,目前尚不清楚 VLMs 是依赖有意义的视觉证据,还是利用了虚假相关性与捷径学习。现有评估协议主要关注分类准确率,而未评估视觉定位。为解决这一局限性,我们引入了 SoccerLens,一个用于视觉定位的足球视频理解基准。该基准包含跨越 种常见足球事件的标注视频片段,其结构化视觉线索被组织为三个层次的语义相关性。我们进一步扩展了 Chefer [arXiv:2103.15679] 的归因方法,以联合建模空间与时间注意力,并引入了评估指标,用于衡量模型注意力是否与标注线索对齐或漂移至虚假区域。我们对最先进的足球 VLMs 的评估表明,尽管分类准确率很高,但即使在最宽松的线索定义下,当前模型的视觉定位性能也无法超过 ,且始终未充分利用时间信息。这些结果揭示了预测性能与真实视觉定位之间的巨大差距,突出了在足球等复杂时空领域中进行视觉定位评估的必要性。
引用
@article{arxiv.2605.09598,
title = {SoccerLens: Grounded Soccer Video Understanding Beyond Accuracy},
author = {Ismael Elsharkawi and Ahmed Sait and Silvio Giancola and Bernard Ghanem and Hossam Sharara and Abdelrahman Eldesokey},
journal= {arXiv preprint arXiv:2605.09598},
year = {2026}
}
备注
Preprint