基于大规模数据的体育视频分析
计算机视觉与模式识别
2022-08-10 v1
摘要
本文研究体育视频上自动化机器描述建模,该方向近期已取得诸多进展。然而,最先进的方法远未能捕捉人类专家分析体育场景的方式。存在几个主要原因:(1)所用数据集采集自非官方提供方,这自然在那些数据集上训练的模型与真实应用间制造了鸿沟;(2)先前提出的方法需要大量的标注工作(即像素级的球员与球分割)来定位有用视觉特征以产生可接受的结果;(3)可用的公开数据集极少。本文中,我们提出一个聚焦于字幕生成的新型大规模NBA体育视频分析数据集(NSVA),以应对上述挑战。我们还设计了一种统一方法,以最小的标注工作量将原始视频处理为一组有意义的特征,并表明使用transformer架构对此类特征进行交叉建模可带来强劲性能。此外,我们通过处理两个额外任务——细粒度体育动作识别与显著球员识别——展示了NSVA的广泛应用。代码与数据集见于 https://github.com/jackwu502/NSVA。
引用
@article{arxiv.2208.04897,
title = {Sports Video Analysis on Large-Scale Data},
author = {Dekun Wu and He Zhao and Xingce Bao and Richard P. Wildes},
journal= {arXiv preprint arXiv:2208.04897},
year = {2022}
}