中文

基于多阶段CNN的未修剪视频时序动作定位

计算机视觉与模式识别 2016-04-25 v2

摘要

我们解决未修剪长视频中的时序动作定位问题。这一点很重要,因为实际应用中的视频通常是无约束的,并且包含多个动作实例以及背景场景或其他活动的视频内容。为解决这一具有挑战性的问题,我们通过三个基于片段的3D ConvNets来利用深度网络在时序动作定位中的有效性:(1) 提议网络识别长视频中可能包含动作的候选片段;(2) 分类网络学习一对一全部(one-vs-all)动作分类模型,作为定位网络的初始化;(3) 定位网络在学到的分类网络上进行微调以定位每个动作实例。我们为定位网络提出一种新颖的损失函数,以显式考虑时间重叠,从而实现高时序定位精度。在预测期间仅使用提议网络和定位网络。在两个大规模基准上,我们的方法相比其他最先进(state-of-the-art)系统取得了显著更优的性能:当评估的重叠阈值设为0.5时,在MEXaction2上mAP从1.7%提升到7.4%,在THUMOS 2014上从15.0%提升到19.0%。

关键词

引用

@article{arxiv.1601.02129,
  title  = {Temporal Action Localization in Untrimmed Videos via Multi-stage CNNs},
  author = {Zheng Shou and Dongang Wang and Shih-Fu Chang},
  journal= {arXiv preprint arXiv:1601.02129},
  year   = {2016}
}

备注

IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2016