中文

BViT:基于广域注意力的视觉 Transformer

计算机视觉与模式识别 2023-06-12 v2

摘要

近期工作表明,通过自注意力挖掘图像块间的关系,Transformer 能在计算机视觉中取得令人瞩目的性能。然而它们仅考虑单一特征层中的注意力,却忽略了不同层级注意力的互补性。本文中,我们提出广域注意力,通过融合视觉 Transformer 不同层的注意力关系来提升性能,称为 BViT。广域注意力由广域连接与无参数注意力实现。各 Transformer 层的广域连接促进了 BViT 的信息传输与整合。无参数注意力在不引入额外可训练参数的情况下,联合关注不同层中已有的注意力信息,以提取有用信息并建立其关系。在图像分类任务上的实验表明,BViT 在 ImageNet 上以 5M/22M 参数取得了 74.8\%/81.6\% 的 state-of-the-art top-1 准确率。此外,我们将 BViT 迁移至下游目标识别基准,在 CIFAR10 与 CIFAR100 上分别达到 98.9\% 与 89.9\%,以更少参数超越 ViT。对于泛化性测试,Swin Transformer 与 T2T-ViT 中的广域注意力也带来了超过 1\% 的提升。总之,广域注意力有望提升基于注意力的模型性能。代码与预训练模型见 https://github.com/DRL-CASIA/Broad_ViT。

关键词

引用

@article{arxiv.2202.06268,
  title  = {BViT: Broad Attention based Vision Transformer},
  author = {Nannan Li and Yaran Chen and Weifan Li and Zixiang Ding and Dongbin Zhao},
  journal= {arXiv preprint arXiv:2202.06268},
  year   = {2023}
}