中文

时空注意力是否为视频理解所需的全部?

计算机视觉与模式识别 2021-06-10 v4

摘要

我们提出了一种无卷积的视频分类方法,完全建立在空间与时间上的自注意力之上。我们的方法名为“TimeSformer”,通过将标准 Transformer 架构适配到视频,直接从帧级图像块序列中实现时空特征学习。我们的实验研究比较了不同的自注意力方案,并表明“分离注意力”(在每个块内分别施加时间注意力和空间注意力)在所考虑的设计选择中带来了最佳的视频分类精度。尽管设计全新,TimeSformer 在多个动作识别基准上取得了最先进的结果,包括在 Kinetics-400 和 Kinetics-600 上报告的最佳精度。最后,与 3D 卷积网络相比,我们的模型训练更快,可以实现显著更高的测试效率(以轻微精度下降为代价),并且还可以应用于长得多(超过一分钟)的视频片段。代码和模型可在 https://github.com/facebookresearch/TimeSformer 获取。

关键词

引用

@article{arxiv.2102.05095,
  title  = {Is Space-Time Attention All You Need for Video Understanding?},
  author = {Gedas Bertasius and Heng Wang and Lorenzo Torresani},
  journal= {arXiv preprint arXiv:2102.05095},
  year   = {2021}
}

备注

Accepted to ICML 2021