基于多任务学习的未修剪视频高效动作检测
计算机视觉与模式识别
2017-04-05 v2 多媒体
摘要
本文研究长未修剪视频中动作识别与时间定位的联合学习。我们采用多任务学习框架,并行执行动作提议、动作识别和动作定位细化这三个高度相关的步骤,而非标准按顺序执行这些步骤的串行流水线。我们提出了一种新颖的时间动作性回归模块,用于估计一个片段包含动作的比例。我们将其用于时间定位,但它也可有其他应用如视频检索、监控、摘要等。我们还在训练期间引入随机剪切增强以模拟视角变化。我们在三个流行视频基准上评估我们的框架。结果表明,我们的联合模型在存储和计算上高效,因为我们无需计算和缓存密集轨迹特征,且比其串行的卷积神经网络(ConvNets)对应模型快数倍。然而,尽管更高效,其在准确率上优于最先进的方法。
引用
@article{arxiv.1612.07403,
title = {Efficient Action Detection in Untrimmed Videos via Multi-Task Learning},
author = {Yi Zhu and Shawn Newsam},
journal= {arXiv preprint arXiv:1612.07403},
year = {2017}
}
备注
WACV 2017 camera ready, minor updates about test time efficiency