SportR:面向运动员多模态大语言模型推理的基准
计算机视觉与模式识别
2026-03-03 v3
摘要
深入理解运动需要细致的视觉感知与规则推理的结合——这一挑战正在推动当前多模态模型的极限。为了成功,模型必须掌握三个关键能力:感知细微的视觉细节、应用抽象的运动规则知识、并将该知识锚定在具体的视觉证据上。当前的运动基准要么覆盖单项运动,要么缺乏详细的推理链和精确的视觉锚定,无法在多运动场景中对这些核心能力进行稳健评估。为此,我们引入SportR——第一个面向多运动的大规模基准,旨在训练和评估实现运动智能所需的基本推理能力。我们的基准包含4,789张图片和2,052个视频。为实现细粒度评估,我们构建了一个渐进式的问答对层级结构,以探索推理深度——从简单违规识别到复杂处罚预测。对于需要多步推理的高级任务(如确定处罚或解释战术),我们提供了6,841组高质量、由人类编写的链式思考(Chain of Thought)注释。此外,基准包含图像和视频两种模态,并提供手动边界框标注,以直接测试图像部分的视觉锚定。大量实验表明,我们的基准具有显著的难度。现有最先进基准模型在最具挑战性的任务上表现不佳。尽管通过监督微调和强化学习可以在数据上进行训练后提升这些分数,但分数仍相对较低,凸显了当前模型能力之间的显著差距。SportR为社区提供了新的挑战,为推动多模态运动推理领域的未来研究提供了关键资源。
引用
@article{arxiv.2511.06499,
title = {SportR: A Benchmark for Multimodal Large Language Model Reasoning in Sports},
author = {Haotian Xia and Haonan Ge and Junbo Zou and Hyun Woo Choi and Xuebin Zhang and Danny Suradja and Botao Rui and Ethan Tran and Wendy Jin and Zhen Ye and Xiyang Lin and Christopher Lai and Shengjie Zhang and Junwen Miao and Shichao Chen and Rhys Tracy and Vicente Ordonez and Weining Shen and Hanjie Chen},
journal= {arXiv preprint arXiv:2511.06499},
year = {2026}
}