中文

基于结构化最大和的时间动作定位

计算机视觉与模式识别 2017-04-18 v1

摘要

我们解决了视频中的时间动作定位问题。我们将动作定位视为对任意长度时间窗口的结构化预测,其中每个窗口的得分是逐帧分类得分之和。此外,我们的模型将每个动作的起始、中间和结束作为独立分量进行分类,使我们的系统能够显式建模每个动作的时间演化,并利用该结构中存在的具有信息量的时间依赖关系。在此框架下,我们通过搜索结构化最大和来定位动作,针对该问题我们开发了一种新颖的、可证明高效的算法解。逐帧分类得分使用深度卷积神经网络(CNN)的特征计算,该网络以端到端方式训练,直接优化一个新的结构化目标。我们在 THUMOS 14 动作检测基准上评估了我们的系统,并取得了具有竞争力的性能。

关键词

引用

@article{arxiv.1704.04671,
  title  = {Temporal Action Localization by Structured Maximal Sums},
  author = {Zehuan Yuan and Jonathan C. Stroud and Tong Lu and Jia Deng},
  journal= {arXiv preprint arXiv:1704.04671},
  year   = {2017}
}

备注

Accepted to CVPR 2017