中文

AdaViT:用于高效图像识别的自适应视觉 Transformer

计算机视觉与模式识别 2021-12-01 v1

摘要

基于自注意力机制,视觉 transformer 近期在多种视觉任务上展现了卓越性能。在取得优异性能的同时,它们仍需要相对密集的计算成本,且随补丁数、自注意力头数与 transformer 块数增加而急剧上升。本文中,我们主张由于图像间存在巨大差异,它们对建模补丁间长距离依赖的需求各不相同。为此,我们引入 AdaViT,一种自适应计算框架,学习推导关于在骨干网络中使用哪些补丁、自注意力头与 transformer 块的使用策略(按每个输入),旨在以最小的图像识别精度下降改善视觉 transformer 的推理效率。轻量级决策网络与 transformer 骨干以端到端方式联合优化,附加于骨干以即时产生决策。在 ImageNet 上的大量实验表明,相较最先进视觉 transformer,我们的方法在精度仅降 0.8% 下取得超 2 倍效率提升,在不同计算预算下实现了良好的效率/精度权衡。我们进一步对学到的使用策略进行定量与定性分析,并提供关于视觉 transformer 中冗余的更多见解。

关键词

引用

@article{arxiv.2111.15668,
  title  = {AdaViT: Adaptive Vision Transformers for Efficient Image Recognition},
  author = {Lingchen Meng and Hengduo Li and Bor-Chun Chen and Shiyi Lan and Zuxuan Wu and Yu-Gang Jiang and Ser-Nam Lim},
  journal= {arXiv preprint arXiv:2111.15668},
  year   = {2021}
}