中文

CrossFormer:一种基于跨尺度注意力的通用视觉Transformer

计算机视觉与模式识别 2021-10-11 v2 机器学习

摘要

Transformer在处理计算机视觉任务方面已取得巨大进展。然而,现有视觉Transformer尚不具备在不同尺度特征间建立交互的能力,而这对视觉输入在感知上十分重要。原因有二:(1)每层输入嵌入为等尺度,因此无法提取跨尺度特征;(2)为降低计算成本,部分视觉Transformer在自注意力模块内合并相邻嵌入,从而牺牲了嵌入的小尺度(细粒度)特征,也破坏了跨尺度交互。为此,我们提出跨尺度嵌入层(CEL)与长短距离注意力(LSDA)。一方面,CEL将每个嵌入与多个不同尺度的图像块相融合,为自注意力模块自身提供跨尺度特征。另一方面,LSDA将自注意力模块拆分为短距离与长距离两部分,不仅降低了计算负担,还保留了嵌入中的小尺度与大尺度特征。通过上述两种设计,我们实现了跨尺度注意力。此外,我们为视觉Transformer提出了一种动态位置偏置,使流行的相对位置偏置可应用于可变尺寸图像。基于跨尺度注意力模块,我们构建了名为CrossFormer的通用视觉架构,其可适配可变尺寸输入。大量实验表明,CrossFormer在图像分类、目标检测、实例分割与语义分割任务上优于其他视觉Transformer。代码已发布:https://github.com/cheerss/CrossFormer。

关键词

引用

@article{arxiv.2108.00154,
  title  = {CrossFormer: A Versatile Vision Transformer Hinging on Cross-scale Attention},
  author = {Wenxiao Wang and Lu Yao and Long Chen and Binbin Lin and Deng Cai and Xiaofei He and Wei Liu},
  journal= {arXiv preprint arXiv:2108.00154},
  year   = {2021}
}

备注

15 pages, 4 figures, and 9 tables