中文

DeepSport:基于智能体强化学习的综合性运动视频理解的多模态大语言模型

计算机视觉与模式识别 2026-03-13 v2 人工智能

摘要

运动视频理解需要感知高速动力学、复杂规则和长时序上下文。然而,当前的多模态大语言模型 (MLLM) 仅聚焦于单一运动项目、特定任务或训练-free 范式。我们引入 DeepSport,这是第一个用于多任务、多运动视频理解的端到端训练 MLLM。DeepSport 采用从被动帧处理转向主动、迭代推理的方式,动态提取帧以"通过视频进行思考"。为训练我们的模型,我们通过严格的三步文本和视觉蒸馏管道构建了统一的 78k 样本数据集。随后采用渐进的两阶段训练策略:首先进行运动课程监督式微调以建立基础感知,然后进行带有新颖工具使用奖励的智能体强化学习。在覆盖面广的 6.7k 基准测试上进行的大量实验表明,DeepSport 实现了最先进的性能,超越了强大的专有和开源模型,同时使用了显著更少的帧。此外,它在对未见运动项目和广泛运动识别任务上表现出强大的零样本迁移能力,为复杂视频推理建立了高效且通用的基础。

关键词

引用

@article{arxiv.2511.12908,
  title  = {DeepSport: A Multimodal Large Language Model for Comprehensive Sports Video Reasoning via Agentic Reinforcement Learning},
  author = {Junbo Zou and Haotian Xia and Zhen Ye and Shengjie Zhang and Christopher Lai and Vicente Ordonez and Weining Shen and Hanjie Chen},
  journal= {arXiv preprint arXiv:2511.12908},
  year   = {2026}
}