动作识别中时空卷积的细致考察
计算机视觉与模式识别
2018-04-13 v3
摘要
本文讨论视频分析中几种形式的时空卷积,并研究其对动作识别的影响。我们的动机源于如下观察:应用于视频单帧的 2D CNN 在动作识别中始终是稳健的表现者。本工作中,我们在残差学习框架下以实证表明 3D CNN 相对于 2D CNN 的精度优势。此外,我们展示将 3D 卷积滤波器分解为独立的空间与时间分量可带来显著的精度优势。我们的实证研究催生了一种新的时空卷积块“R(2+1)D”,由此得到的 CNN 在 Sports-1M、Kinetics、UCF101 与 HMDB51 上取得了与最先进水平相当或更优的结果。
引用
@article{arxiv.1711.11248,
title = {A Closer Look at Spatiotemporal Convolutions for Action Recognition},
author = {Du Tran and Heng Wang and Lorenzo Torresani and Jamie Ray and Yann LeCun and Manohar Paluri},
journal= {arXiv preprint arXiv:1711.11248},
year = {2018}
}