面向非结构化体育视频中事件检测的无监督时间特征聚合
计算机视觉与模式识别
2020-02-20 v1
摘要
基于图像的运动分析能够实现比赛中关键事件的自动检索,从而加速人类专家的分析过程。然而,大多数现有方法聚焦于结构化的电视转播视频数据集,这类数据使用平直且固定的摄像机,拍摄位姿变化极小。本文研究任意摄像机角度下非结构化环境中体育视频的事件检测问题。从结构化到非结构化视频分析的转变为我们带来了多项挑战,本文逐一解决。具体而言,我们识别并解决了两个主要问题:非结构化设定下运动员的无监督识别,以及因任意拍摄角度导致的位姿变化下训练模型的泛化。针对第一个问题,我们提出一种利用行人重识别特征的时间特征聚合算法,通过增强一个弱启发式打分方法获得较高的运动员检索精度。此外,我们提出一种基于多模态图像翻译模型的数据增强技术,以减少训练样本外观中的偏差。实验评估表明,对于斜角视频,我们提出的方法将运动员检索精度从 0.78 提升至 0.86。另外,在乒乓球视频的回合检测中,使用我们提出的运动员级特征,F1 分数从全局帧级特征的 0.79 提升至 0.89。请见补充视频提交:https://ibm.biz/BdzeZA。
引用
@article{arxiv.2002.08097,
title = {Unsupervised Temporal Feature Aggregation for Event Detection in Unstructured Sports Videos},
author = {Subhajit Chaudhury and Daiki Kimura and Phongtharin Vinayavekhin and Asim Munawar and Ryuki Tachibana and Koji Ito and Yuki Inaba and Minoru Matsumoto and Shuji Kidokoro and Hiroki Ozaki},
journal= {arXiv preprint arXiv:2002.08097},
year = {2020}
}
备注
Accepted to IEEE International Symposium on Multimedia, 2019