中文

基于图像CNN特征的动作识别

计算机视觉与模式识别 2015-12-15 v1

摘要

大多数人类动作由较简单动作的复杂时间组合构成。动作识别任务通常依赖复杂的手工设计结构作为特征来表示人类动作模型。卷积神经网络(CNN)已被证明是一种强大的工具,消除了设计手工特征的需要。通常,CNN中最后一层的输出(分类层之前的层,称为fc7)被用作图像的通用特征。在本文中,我们表明当网络仅在图像上训练时,fc7特征本身无法在动作识别任务上获得良好性能。我们提出了一种基于fc7特征之上的特征结构,能够捕捉视频中的时间变化。为了表示捕捉运动信息所需的时间成分,我们引入了层次结构。该层次模型能够从复杂动作中捕获子动作。在层次的高层,它表示对动作序列的粗略捕捉,低层表示精细的动作元素。此外,我们引入了一种利用视频中每帧的二值编码提取关键帧的方法,有助于提升我们层次模型的性能。我们在多个动作数据集上实验,表明我们的方法相较于其他最先进(state-of-the-art)方法取得了更优结果。

关键词

引用

@article{arxiv.1512.03980,
  title  = {Action Recognition with Image Based CNN Features},
  author = {Mahdyar Ravanbakhsh and Hossein Mousavi and Mohammad Rastegari and Vittorio Murino and Larry S. Davis},
  journal= {arXiv preprint arXiv:1512.03980},
  year   = {2015}
}