中文

Slide-Transformer:具有局部自注意力的分层视觉 Transformer

计算机视觉与模式识别 2023-04-11 v1

摘要

自注意力机制是 Vision Transformer(ViT)近期进展的关键因素,其能够从全局上下文中自适应提取特征。然而,现有的自注意力方法要么采用稀疏全局注意力,要么采用窗口注意力来降低计算复杂度,这可能损害局部特征学习或受制于一些手工设计。相比之下,局部注意力将每个查询的感知域限制在其邻近像素内,兼具卷积和自注意力的优点,即局部归纳偏置和动态特征选择。尽管如此,当前的局部注意力模块要么使用低效的 Im2Col 函数,要么依赖特定的 CUDA 内核,难以推广到无 CUDA 支持的设备。本文中,我们提出一种新颖的局部注意力模块,Slide Attention,其利用常规卷积操作来实现高效率、灵活性和通用性。具体而言,我们首先从新的基于行的视角重新解读基于列的 Im2Col 函数,并使用深度可分离卷积(Depthwise Convolution)作为高效替代。在此基础上,我们提出一种基于重参数化技术的形变偏移模块,进一步将固定的键/值位置松弛为局部区域中的形变特征。由此,我们的模块以高效且灵活的方式实现了局部注意力范式。大量实验表明,我们的 slide 注意力模块适用于多种先进的 Vision Transformer 模型,并与各类硬件设备兼容,在综合基准上取得了一致的性能提升。代码发布于 https://github.com/LeapLabTHU/Slide-Transformer。

关键词

引用

@article{arxiv.2304.04237,
  title  = {Slide-Transformer: Hierarchical Vision Transformer with Local Self-Attention},
  author = {Xuran Pan and Tianzhu Ye and Zhuofan Xia and Shiji Song and Gao Huang},
  journal= {arXiv preprint arXiv:2304.04237},
  year   = {2023}
}

备注

Accepted to CVPR2023