中文

利用有效感受野理解视觉Transformer的高斯注意力偏置

计算机视觉与模式识别 2023-05-09 v1

摘要

将图像建模为分块序列的视觉Transformer(ViT)已在多种视觉任务中展现出显著性能。由于分块消除了图像结构,为反映分块顺序,ViT 使用了一种称为位置嵌入的显式组件。然而,我们主张位置嵌入的使用并不能简单保证 ViT 的顺序感知能力。为支持该主张,我们利用有效感受野分析了 ViT 的实际行为。我们证明在训练过程中,ViT 从被训练为特定模式的位置嵌入中获取对分块顺序的理解。基于该观察,我们提出显式添加高斯注意力偏置,从训练开始就引导位置嵌入具有相应模式。我们在若干图像分类、目标检测和语义分割实验中评估了高斯注意力偏置对 ViT 性能的影响。结果表明,所提方法不仅有助于 ViT 理解图像,还在包括 ImageNet、COCO 2017 和 ADE20K 在内的多个数据集上提升了其性能。

关键词

引用

@article{arxiv.2305.04722,
  title  = {Understanding Gaussian Attention Bias of Vision Transformers Using Effective Receptive Fields},
  author = {Bum Jun Kim and Hyeyeon Choi and Hyeonah Jang and Sang Woo Kim},
  journal= {arXiv preprint arXiv:2305.04722},
  year   = {2023}
}

备注

11 pages, 7 Figures