中文

基于 CNN 的时空表征用于动作识别的深度分析

计算机视觉与模式识别 2021-03-30 v4

摘要

近年来,许多基于 2D 或 3D 卷积神经网络(CNN)的方法涌现用于视频动作识别,在多个大规模基准数据集上取得了最先进(SOTA)结果。在本文中,我们进行了深入的对比分析,以更好地理解这些方法之间的差异及其所取得的进展。为此,我们为 2D-CNN 和 3D-CNN 动作模型开发了一个统一框架,使我们能够去除花哨技巧并提供公平比较的共同基础。随后我们致力于一项涉及超过 300 个动作识别模型的大规模分析。我们的综合分析表明:a) 动作识别在效率上取得了显著飞跃,但在准确率上并未;b) 2D-CNN 与 3D-CNN 模型在时空表征能力与可迁移性方面表现相似。我们的代码可在 https://github.com/IBM/action-recognition-pytorch 获取。

关键词

引用

@article{arxiv.2010.11757,
  title  = {Deep Analysis of CNN-based Spatio-temporal Representations for Action Recognition},
  author = {Chun-Fu Chen and Rameswar Panda and Kandan Ramakrishnan and Rogerio Feris and John Cohn and Aude Oliva and Quanfu Fan},
  journal= {arXiv preprint arXiv:2010.11757},
  year   = {2021}
}

备注

CVPR 2021 camera-ready version. Codes and models are available on https://github.com/IBM/action-recognition-pytorch