中文

视频 Transformer 网络

计算机视觉与模式识别 2021-08-18 v3

摘要

本文提出 VTN,一种基于 Transformer 的视频识别框架。受视觉 Transformer 近期发展的启发,我们摒弃了视频动作识别中依赖 3D 卷积网络的标准方法,并引入一种通过对整个视频序列信息进行注意力机制来分类动作的方法。我们的方法是通用的,并构建于任意给定的 2D 空间网络之上。在挂钟运行时间方面,与其他最先进(SOTA)方法相比,其训练速度快 16.1×16.1\times,推理时运行快 5.1×5.1\times,同时保持具有竞争力的准确率。它通过单次端到端前向传播即可实现整段视频分析,同时所需 GFLOPs 减少 1.5×1.5\times。我们在 Kinetics-400 上报告了具有竞争力的结果,并对 VTN 的特性以及准确率与推理速度之间的权衡进行了消融研究。我们希望我们的方法能作为一个新的基线,并在视频识别领域开启一条全新的研究路线。代码与模型可在以下地址获取:https://github.com/bomri/SlowFast/blob/master/projects/vtn/README.md

关键词

引用

@article{arxiv.2102.00719,
  title  = {Video Transformer Network},
  author = {Daniel Neimark and Omri Bar and Maya Zohar and Dotan Asselmann},
  journal= {arXiv preprint arXiv:2102.00719},
  year   = {2021}
}