中文

识别足球动作是否需要大型视觉语言模型?

计算机视觉与模式识别 2025-09-30 v2 人工智能 机器学习

摘要

传统的基于视频的任务(如足球动作识别)严重依赖视觉输入,通常需要复杂且计算成本高昂的模型来处理密集的视频数据。我们提出从这种以视频为中心的方法转向基于文本的任务,通过利用大型语言模型(LLM)而非视觉语言模型(VLM)使其变得轻量且可扩展。我们认为,提供丰富描述和上下文线索的专家解说包含足够的信息,可以可靠地识别比赛中的关键动作。为了证明这一点,我们采用了一个由三个LLM组成的系统,它们分别专门负责结果、兴奋度和战术,用于识别足球比赛中的动作。我们的实验表明,这种以语言为中心的方法在检测关键比赛事件方面表现有效,其性能接近最先进的基于视频的识别器,同时使用的视频处理计算量为零,处理整场比赛的时间也相近。

关键词

引用

@article{arxiv.2506.17144,
  title  = {Do We Need Large VLMs for Spotting Soccer Actions?},
  author = {Ritabrata Chakraborty and Rajatsubhra Chakraborty and Avijit Dasgupta and Sandeep Chaurasia},
  journal= {arXiv preprint arXiv:2506.17144},
  year   = {2025}
}

备注

6 pages, 2 tables