基于 CNN 的时空表征用于动作识别的深度分析
计算机视觉与模式识别
2021-03-30 v4
摘要
近年来,许多基于 2D 或 3D 卷积神经网络(CNN)的方法涌现用于视频动作识别,在多个大规模基准数据集上取得了最先进(SOTA)结果。在本文中,我们进行了深入的对比分析,以更好地理解这些方法之间的差异及其所取得的进展。为此,我们为 2D-CNN 和 3D-CNN 动作模型开发了一个统一框架,使我们能够去除花哨技巧并提供公平比较的共同基础。随后我们致力于一项涉及超过 300 个动作识别模型的大规模分析。我们的综合分析表明:a) 动作识别在效率上取得了显著飞跃,但在准确率上并未;b) 2D-CNN 与 3D-CNN 模型在时空表征能力与可迁移性方面表现相似。我们的代码可在 https://github.com/IBM/action-recognition-pytorch 获取。
引用
@article{arxiv.2010.11757,
title = {Deep Analysis of CNN-based Spatio-temporal Representations for Action Recognition},
author = {Chun-Fu Chen and Rameswar Panda and Kandan Ramakrishnan and Rogerio Feris and John Cohn and Aude Oliva and Quanfu Fan},
journal= {arXiv preprint arXiv:2010.11757},
year = {2021}
}
备注
CVPR 2021 camera-ready version. Codes and models are available on https://github.com/IBM/action-recognition-pytorch