中文

基于因子化时空卷积网络的人类动作识别

计算机视觉与模式识别 2015-10-05 v1

摘要

视频序列中的人类动作是三维(3D)时空信号,表征了相关人和物体的视觉外观和运动动态。受卷积神经网络(CNN)在图像分类上成功的启发,近期尝试学习3D CNN来识别视频中的人类动作。然而,部分由于训练3D卷积核的高复杂性以及对大量训练视频的需求,仅取得了有限成功。这促使我们在本文中研究一种能更有效处理3D信号的新深度架构。具体而言,我们提出因子化时空卷积网络(FstCN),将原始3D卷积核学习分解为顺序过程:先在低层学习2D空间核(称为空间卷积层),然后在高层学习1D时间核(称为时间卷积层)。我们引入一种新颖的变换和排列算子使FstCN中的因子化成为可能。此外,为解决序列对齐问题,我们提出一种基于从给定动作视频序列中采样多个视频片段的有效训练和推理策略。我们在两个常用基准数据集(UCF-101和HMDB-51)上测试了FstCN。在不使用辅助训练视频提升性能的情况下,FstCN优于现有基于CNN的方法,并达到了与近期一种利用辅助训练视频的方法相当的性能。

关键词

引用

@article{arxiv.1510.00562,
  title  = {Human Action Recognition using Factorized Spatio-Temporal Convolutional Networks},
  author = {Lin Sun and Kui Jia and Dit-Yan Yeung and Bertram E. Shi},
  journal= {arXiv preprint arXiv:1510.00562},
  year   = {2015}
}