中文

在线实时多时空动作定位与预测

计算机视觉与模式识别 2017-08-25 v6

摘要

我们提出了一种深度学习框架,用于实时多时空(S/T)动作定位、分类与早期预测。当前最先进的方法为离线工作,且过于缓慢而无法在真实世界场景中发挥作用。为克服其局限性,我们引入了两项主要进展。首先,我们采用实时 SSD(Single Shot MultiBox Detector)卷积神经网络来回归并分类每个视频帧中可能包含感兴趣动作的检测框。其次,我们设计了一种新颖且高效的在线算法,从 SSD 帧级检测增量式地构建并标注“动作管”。因此,我们的系统不仅能够实时执行 S/T 检测,还能以在线方式进行早期动作预测。我们在具有挑战性的 UCF101-24 和 J-HMDB-21 基准上,在 S/T 动作定位与早期动作预测两方面均取得了新的最先进结果,即使与顶尖的离线竞争者相比也是如此。据我们所知,我们的系统是首个能够在 UCF101-24 未裁剪视频上执行在线 S/T 动作定位与早期动作预测的实时(高达 40fps)系统。

关键词

引用

@article{arxiv.1611.08563,
  title  = {Online Real-time Multiple Spatiotemporal Action Localisation and Prediction},
  author = {Gurkirt Singh and Suman Saha and Michael Sapienza and Philip Torr and Fabio Cuzzolin},
  journal= {arXiv preprint arXiv:1611.08563},
  year   = {2017}
}

备注

10 pages 3 figures, ICCV 2017, Added link to new annotations of ucf101-24