中文

Video Swin Transformer

计算机视觉与模式识别 2021-06-25 v1 人工智能 机器学习

摘要

视觉领域正经历从 CNN 到 Transformer 的建模转变,纯 Transformer 架构已在主要视频识别基准上取得顶尖准确率。这些视频模型均构建于在时空维度上全局连接补丁的 Transformer 层。本文中,我们转而倡导视频 Transformer 中的局部性归纳偏置,与先前即使采用时空分解仍全局计算自注意力的方法相比,这带来了更好的速度-准确率权衡。所提视频架构的局部性通过适配为图像域设计的 Swin Transformer 实现,同时继续利用预训练图像模型的威力。我们的方法在广泛的视频识别基准上达到最先进准确率,包括动作识别(Kinetics-400 上 84.9 top-1 准确率,Kinetics-600 上 86.1 top-1 准确率,且预训练数据少约 20 倍、模型小约 3 倍)与时序建模(Something-Something v2 上 69.6 top-1 准确率)。代码与模型将公开于 https://github.com/SwinTransformer/Video-Swin-Transformer。

关键词

引用

@article{arxiv.2106.13230,
  title  = {Video Swin Transformer},
  author = {Ze Liu and Jia Ning and Yue Cao and Yixuan Wei and Zheng Zhang and Stephen Lin and Han Hu},
  journal= {arXiv preprint arXiv:2106.13230},
  year   = {2021}
}