中文

StNet:用于动作识别的局部与全局时空建模网络

计算机视觉与模式识别 2018-12-12 v3

摘要

尽管深度学习在静态图像理解方面取得了成功,但对于视频中时空建模最有效的网络架构仍不明确。本文不同于现有的 CNN+RNN 或纯 3D 卷积方法,探索了一种新颖的时空网络(StNet)架构,用于视频中局部与全局的时空建模。具体而言,StNet 将 N 个连续视频帧堆叠为一个具有 3N 个通道的“超图像”(super-image),并在超图像上应用 2D 卷积以捕获局部时空关系。为建模全局时空关系,我们在局部时空特征图上施加时序卷积。特别地,StNet 中提出了一种新颖的时序 Xception 模块,它对视频的特征序列采用分离的通道维与时序维卷积。在 Kinetics 数据集上的大量实验表明,我们的框架在动作识别上优于若干 SOTA 方法,并能在识别精度与模型复杂度之间取得令人满意的权衡。我们进一步在 UCF101 数据集上展示了所学视频表示的泛化性能。

关键词

引用

@article{arxiv.1811.01549,
  title  = {StNet: Local and Global Spatial-Temporal Modeling for Action Recognition},
  author = {Dongliang He and Zhichao Zhou and Chuang Gan and Fu Li and Xiao Liu and Yandong Li and Limin Wang and Shilei Wen},
  journal= {arXiv preprint arXiv:1811.01549},
  year   = {2018}
}

备注

AAAI2019