基于BERT在3D CNN架构中引入后期时间建模的动作识别方法
计算机视觉与模式识别
2020-09-21 v3
摘要
在这项工作中,我们将3D卷积与后期时间建模相结合用于动作识别。为此,我们将3D卷积架构末端的常规时间全局平均池化(TGAP)层替换为来自Transformer的双向编码器表示(BERT)层,以便利用BERT的注意力机制更好地利用时间信息。我们表明,这一替换提升了许多流行的3D卷积动作识别架构的性能,包括ResNeXt、I3D、SlowFast和R(2+1)D。此外,我们在HMDB51和UCF101数据集上分别取得了85.10%和98.69%的top-1准确率,达到了当前最优结果。代码已公开可用。
引用
@article{arxiv.2008.01232,
title = {Late Temporal Modeling in 3D CNN Architectures with BERT for Action Recognition},
author = {M. Esat Kalfaoglu and Sinan Kalkan and A. Aydin Alatan},
journal= {arXiv preprint arXiv:2008.01232},
year = {2020}
}
备注
Presented on the 2nd Workshop on Video Turing Test: Toward Human-Level Video Story Understanding, ECCV 2020