中文

基于并行多感受野一维卷积的粗标注体育视频事件检测

计算机视觉与模式识别 2020-04-15 v1

摘要

在体育视频分析等问题中,由于视频冗长且数据量巨大,难以获得准确的帧级标注与精确事件时长。该问题在冰球等快节奏运动中更为突出。以粗粒度获取标注可实用得多且更省时。我们提出粗标注视频中的事件检测任务。我们为所提任务引入了一种多塔时间卷积网络架构。该网络借助多个感受野在不同时间尺度上处理信息,以应对关于精确事件位置与时长的不确定性。我们通过恰当的消融研究证明了多感受野架构的有效性。该方法在两个任务上进行了评估——NHL 数据集中粗标注冰球视频的事件检测,以及 SoccerNet 数据集上足球的事件定位。两个数据集均缺乏帧级标注且事件频率差异显著。实验结果表明该网络的有效性:在 NHL 数据集上取得 55% 的平均 F1 分数,并在 SoccerNet 数据集上取得与 SOTA 相竞争的性能。我们相信我们的方法将有助于构建更实用的体育视频事件检测流程。

关键词

引用

@article{arxiv.2004.06172,
  title  = {Event detection in coarsely annotated sports videos via parallel multi receptive field 1D convolutions},
  author = {Kanav Vats and Mehrnaz Fani and Pascale Walters and David A. Clausi and John Zelek},
  journal= {arXiv preprint arXiv:2004.06172},
  year   = {2020}
}