中文

动作识别中时空卷积的细致考察

计算机视觉与模式识别 2018-04-13 v3

摘要

本文讨论视频分析中几种形式的时空卷积,并研究其对动作识别的影响。我们的动机源于如下观察:应用于视频单帧的 2D CNN 在动作识别中始终是稳健的表现者。本工作中,我们在残差学习框架下以实证表明 3D CNN 相对于 2D CNN 的精度优势。此外,我们展示将 3D 卷积滤波器分解为独立的空间与时间分量可带来显著的精度优势。我们的实证研究催生了一种新的时空卷积块“R(2+1)D”,由此得到的 CNN 在 Sports-1M、Kinetics、UCF101 与 HMDB51 上取得了与最先进水平相当或更优的结果。

关键词

引用

@article{arxiv.1711.11248,
  title  = {A Closer Look at Spatiotemporal Convolutions for Action Recognition},
  author = {Du Tran and Heng Wang and Lorenzo Torresani and Jamie Ray and Yann LeCun and Manohar Paluri},
  journal= {arXiv preprint arXiv:1711.11248},
  year   = {2018}
}