中文

基于掩码预训练的多模态足球场景分析

计算机视觉与模式识别 2025-12-23 v1

摘要

本文提出一种用于从战术摄像机 footage 中分析足球场景的多模态架构,聚焦于三个核心任务:球踢轨迹推断、球状态分类和球权人识别。为此,我们的解决方案将三种不同输入模态(球员轨迹、球员类型和单个球员的图像裁剪)集成到一个统一框架中,使用级联的社会时序变换器块处理空间和时间动态。不同于以往方法依赖精确的球踢跟踪或手工启发式方法,本方法无需直接获取球踢的过去或未来位置,能够在真实顶级联赛的噪声或遮挡条件下稳健地识别球状态和球权人。我们还引入CropDrop,这是一种针对性模态的掩码预训练策略,防止图像特征过度依赖,鼓励模型在预训练期间依赖跨模态模式。我们在大规模数据集上展示了该方法的有效性,在所有任务中均显著优于领先的基线方法。我们的结果凸显了在变换器架构中结合结构化和视觉线索的优势,以及现实掩码策略在多模态学习中的重要性。

关键词

引用

@article{arxiv.2512.19528,
  title  = {Multi-Modal Soccer Scene Analysis with Masked Pre-Training},
  author = {Marc Peral and Guillem Capellera and Luis Ferraz and Antonio Rubio and Antonio Agudo},
  journal= {arXiv preprint arXiv:2512.19528},
  year   = {2025}
}

备注

10 pages, 2 figures. WACV 2026