利用有效感受野理解视觉Transformer的高斯注意力偏置
计算机视觉与模式识别
2023-05-09 v1
摘要
将图像建模为分块序列的视觉Transformer(ViT)已在多种视觉任务中展现出显著性能。由于分块消除了图像结构,为反映分块顺序,ViT 使用了一种称为位置嵌入的显式组件。然而,我们主张位置嵌入的使用并不能简单保证 ViT 的顺序感知能力。为支持该主张,我们利用有效感受野分析了 ViT 的实际行为。我们证明在训练过程中,ViT 从被训练为特定模式的位置嵌入中获取对分块顺序的理解。基于该观察,我们提出显式添加高斯注意力偏置,从训练开始就引导位置嵌入具有相应模式。我们在若干图像分类、目标检测和语义分割实验中评估了高斯注意力偏置对 ViT 性能的影响。结果表明,所提方法不仅有助于 ViT 理解图像,还在包括 ImageNet、COCO 2017 和 ADE20K 在内的多个数据集上提升了其性能。
引用
@article{arxiv.2305.04722,
title = {Understanding Gaussian Attention Bias of Vision Transformers Using Effective Receptive Fields},
author = {Bum Jun Kim and Hyeyeon Choi and Hyeonah Jang and Sang Woo Kim},
journal= {arXiv preprint arXiv:2305.04722},
year = {2023}
}
备注
11 pages, 7 Figures