中文

基于BERT在3D CNN架构中引入后期时间建模的动作识别方法

计算机视觉与模式识别 2020-09-21 v3

摘要

在这项工作中,我们将3D卷积与后期时间建模相结合用于动作识别。为此,我们将3D卷积架构末端的常规时间全局平均池化(TGAP)层替换为来自Transformer的双向编码器表示(BERT)层,以便利用BERT的注意力机制更好地利用时间信息。我们表明,这一替换提升了许多流行的3D卷积动作识别架构的性能,包括ResNeXt、I3D、SlowFast和R(2+1)D。此外,我们在HMDB51和UCF101数据集上分别取得了85.10%和98.69%的top-1准确率,达到了当前最优结果。代码已公开可用。

关键词

引用

@article{arxiv.2008.01232,
  title  = {Late Temporal Modeling in 3D CNN Architectures with BERT for Action Recognition},
  author = {M. Esat Kalfaoglu and Sinan Kalkan and A. Aydin Alatan},
  journal= {arXiv preprint arXiv:2008.01232},
  year   = {2020}
}

备注

Presented on the 2nd Workshop on Video Turing Test: Toward Human-Level Video Story Understanding, ECCV 2020