中文

TennisTV:多模态大语言模型是否理解网球回合?

计算机视觉与模式识别 2026-04-17 v5

摘要

多模态大语言模型(MLLMs)在通用视频理解方面表现出色,但在面对网球等快速高频率的运动时却感到困难,因为回合片段短暂却信息密集。为系统评估 MLLMs 在这一具备挑战性的领域中的表现,我们提出了 TennisTV——第一个也是最全面的网球视频理解基准。TennisTV 将每个回合建模为时间顺序的连续击球事件序列,采用自动化管道进行筛选和问题生成。它覆盖从球员技术层面到回合层面的 8 项任务,并包括 2527 个人工验证的问题。我们评估了 17 个具有代表性的 MLLMs,首次系统地评估了网球视频理解。结果得出两个关键洞察:(1)帧抽样密度应针对各任务进行平衡调节;(2)提高时序定位对于更强的推理至关重要。

关键词

引用

@article{arxiv.2509.15602,
  title  = {TennisTV: Do Multimodal Large Language Models Understand Tennis Rallies?},
  author = {Zhongyuan Bao and Lejun Zhang},
  journal= {arXiv preprint arXiv:2509.15602},
  year   = {2026}
}