中文

面向足球视频理解的视觉语言模型域适应

计算机视觉与模式识别 2025-07-08 v2 人工智能

摘要

视觉语言模型(VLM)在多模态任务中通过有效地对齐视觉与文本表征,展现出强大的性能。然而,大多数视频理解类的 VLM 研究都缺乏域无关性,对其在特定领域的迁移学习能力的理解仍受到 insufficient 探索。本文通过探索开源 VLM 对特定领域的适应性,以足球作为初始案例研究。我们的做法利用大规模足球数据集和大语言模型创建指令遵循数据,并以分层学习方式对通用领域 VLM 进行迭代微调(首先教会模型关键足球概念,再进行问答任务)。经过 20,000 条视频剪辑精选数据集训练的最终适应模型,在足球特定任务上相较于基线模型表现显著提升,视觉问答任务实现 37.5% 的相对改进,下游足球动作分类任务的准确率提升至从 11.8% 提升至 63.5%。

关键词

引用

@article{arxiv.2505.13860,
  title  = {Domain Adaptation of VLM for Soccer Video Understanding},
  author = {Tiancheng Jiang and Henry Wang and Md Sirajus Salekin and Parmida Atighehchian and Shinan Zhang},
  journal= {arXiv preprint arXiv:2505.13860},
  year   = {2025}
}

备注

8 pages, 5 figures, accepted to the 11th IEEE International Workshop on Computer Vision in Sports (CVSports) at CVPR 2025; supplementary appendix included