高效无注意力视频移位 Transformer
计算机视觉与模式识别
2022-08-24 v1 机器学习
摘要
本文解决高效视频识别问题。在该领域,视频 transformer 近来主导了效率(top-1 准确率 vs FLOPs)谱系。同时,在图像领域已有一些尝试质疑 transformer 架构中自注意力操作的必要性,主张使用更简单的 token 混合方法。然而,对于视频识别情形尚无结果,其中自注意力算子(相比图像情形)对效率有显著影响。为弥补此空白,本文作出如下贡献:(a) 我们基于移位算子构建了高度高效且准确的无注意力模块,称为 Affine-Shift 模块,专门设计以尽可能逼近 Transformer 层中 MHSA 模块的操作。基于我们的 Affine-Shift 模块,我们构建了 Affine-Shift Transformer,并展示其已在 ImageNet 分类上超越所有现有的基于移位/MLP 的架构。(b) 我们将公式推广至视频领域以构建 Video Affine-Shift Transformer (VAST),这是首个纯无注意力的基于移位的视频 transformer。(c) 我们展示 VAST 在低计算与内存占用的模型情形下,于最流行的动作识别基准上显著优于近期最先进的 transformer。代码将公开。
引用
@article{arxiv.2208.11108,
title = {Efficient Attention-free Video Shift Transformers},
author = {Adrian Bulat and Brais Martinez and Georgios Tzimiropoulos},
journal= {arXiv preprint arXiv:2208.11108},
year = {2022}
}