中文

从视频帧瞥见中端到端学习动作检测

计算机视觉与模式识别 2017-03-14 v2 机器学习

摘要

在本工作中,我们提出了一种用于视频中动作检测的全端到端方法,该方法学习直接预测动作的时间边界。我们的直觉是,检测动作的过程天然是一个观察与精炼的过程:观察视频中的时刻,并精炼关于动作发生时间的假设。基于这一洞见,我们将模型构建为一个基于循环神经网络(RNN)的智能体,随时间与视频交互。该智能体观察视频帧,并决定下一步看哪里以及何时发出预测。由于反向传播在这种不可微设定中不够充分,我们使用 REINFORCE 来学习智能体的决策策略。我们的模型在 THUMOS'14 和 ActivityNet 数据集上取得了最先进的(state-of-the-art, SOTA)结果,同时仅观察了视频帧的一小部分(2% 或更少)。

关键词

引用

@article{arxiv.1511.06984,
  title  = {End-to-end Learning of Action Detection from Frame Glimpses in Videos},
  author = {Serena Yeung and Olga Russakovsky and Greg Mori and Li Fei-Fei},
  journal= {arXiv preprint arXiv:1511.06984},
  year   = {2017}
}

备注

Update to version in CVPR 2016 proceedings