基于结构化最大和的时间动作定位
计算机视觉与模式识别
2017-04-18 v1
摘要
我们解决了视频中的时间动作定位问题。我们将动作定位视为对任意长度时间窗口的结构化预测,其中每个窗口的得分是逐帧分类得分之和。此外,我们的模型将每个动作的起始、中间和结束作为独立分量进行分类,使我们的系统能够显式建模每个动作的时间演化,并利用该结构中存在的具有信息量的时间依赖关系。在此框架下,我们通过搜索结构化最大和来定位动作,针对该问题我们开发了一种新颖的、可证明高效的算法解。逐帧分类得分使用深度卷积神经网络(CNN)的特征计算,该网络以端到端方式训练,直接优化一个新的结构化目标。我们在 THUMOS 14 动作检测基准上评估了我们的系统,并取得了具有竞争力的性能。
引用
@article{arxiv.1704.04671,
title = {Temporal Action Localization by Structured Maximal Sums},
author = {Zehuan Yuan and Jonathan C. Stroud and Tong Lu and Jia Deng},
journal= {arXiv preprint arXiv:1704.04671},
year = {2017}
}
备注
Accepted to CVPR 2017