中文

用于基于视频的动作识别的时序感知卷积池化

计算机视觉与模式识别 2016-02-02 v1

摘要

大多数基于视频的动作识别方法通过时间池化每帧提取的特征来创建视频级表示。然而,它们采用的池化方法通常完全或部分忽略时间域中包含的动态信息,这可能削弱所得视频表示的判别力,因为视频序列顺序可以揭示特定事件或动作的演变。为克服此缺点并探索融入时间顺序信息的重要性,本文提出一种新颖的时间池化方法来聚合帧级特征。受卷积神经网络(CNN)利用图像内部结构进行信息抽象的能力启发,我们提出将时间卷积操作应用于帧级表示以提取动态信息。然而,直接在原始高维特征上实现该想法将不可避免地导致参数爆炸。为解决此问题,我们将每个特征维度上特征值的时间演化视为一维信号,并为这些一维信号中的每个学习一个独特的卷积滤波器组。我们在两个具有挑战性的基于视频的动作识别数据集 HMDB51 和 UCF101 上进行了实验,并证明所提方法优于常规池化方法。

关键词

引用

@article{arxiv.1602.00224,
  title  = {Order-aware Convolutional Pooling for Video Based Action Recognition},
  author = {Peng Wang and Lingqiao Liu and Chunhua Shen and Heng Tao Shen},
  journal= {arXiv preprint arXiv:1602.00224},
  year   = {2016}
}

备注

10 pages