基于多阶段CNN的未修剪视频时序动作定位
计算机视觉与模式识别
2016-04-25 v2
摘要
我们解决未修剪长视频中的时序动作定位问题。这一点很重要,因为实际应用中的视频通常是无约束的,并且包含多个动作实例以及背景场景或其他活动的视频内容。为解决这一具有挑战性的问题,我们通过三个基于片段的3D ConvNets来利用深度网络在时序动作定位中的有效性:(1) 提议网络识别长视频中可能包含动作的候选片段;(2) 分类网络学习一对一全部(one-vs-all)动作分类模型,作为定位网络的初始化;(3) 定位网络在学到的分类网络上进行微调以定位每个动作实例。我们为定位网络提出一种新颖的损失函数,以显式考虑时间重叠,从而实现高时序定位精度。在预测期间仅使用提议网络和定位网络。在两个大规模基准上,我们的方法相比其他最先进(state-of-the-art)系统取得了显著更优的性能:当评估的重叠阈值设为0.5时,在MEXaction2上mAP从1.7%提升到7.4%,在THUMOS 2014上从15.0%提升到19.0%。
引用
@article{arxiv.1601.02129,
title = {Temporal Action Localization in Untrimmed Videos via Multi-stage CNNs},
author = {Zheng Shou and Dongang Wang and Shih-Fu Chang},
journal= {arXiv preprint arXiv:1601.02129},
year = {2016}
}
备注
IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2016