中文

邻域视觉Transformer

计算机视觉与模式识别 2023-07-21 v2

摘要

视觉Transformer在众多计算机视觉任务上取得了巨大成功。然而,其核心组件softmax注意力由于计算复杂度和内存占用均为二次方,阻碍了视觉Transformer扩展到高分辨率图像。尽管线性注意力在自然语言处理(NLP)任务中被引入以缓解类似问题,但直接将在NLP中已有的线性注意力应用于视觉Transformer可能无法得到令人满意的结果。我们研究了该问题,发现与NLP任务相比,计算机视觉任务更关注局部信息。基于这一观察,我们提出了一种邻域注意力(Vicinity Attention),以线性复杂度为视觉Transformer引入局部性偏置。具体而言,对于每个图像块,我们根据由其邻近块度量的二维曼哈顿距离来调整其注意力权重。这样,邻近块将比远处的块获得更强的注意力。此外,由于我们的邻域注意力需要令牌长度远大于特征维度才能体现其效率优势,我们进一步提出了一种新的邻域视觉Transformer(VVT)结构,以在不退化精度的情况下降低特征维度。我们在CIFAR100、ImageNet1K和ADE20K数据集上进行了大量实验来验证我们方法的有效性。当输入分辨率增大时,我们的方法的GFlops增长速度慢于以往基于Transformer和基于卷积的网络。特别地,我们的方法以比以往方法少50%的参数实现了最先进的图像分类精度。

关键词

引用

@article{arxiv.2206.10552,
  title  = {Vicinity Vision Transformer},
  author = {Weixuan Sun and Zhen Qin and Hui Deng and Jianyuan Wang and Yi Zhang and Kaihao Zhang and Nick Barnes and Stan Birchfield and Lingpeng Kong and Yiran Zhong},
  journal= {arXiv preprint arXiv:2206.10552},
  year   = {2023}
}

备注

code: https://github.com/OpenNLPLab/Vicinity-Vision-Transformer