中文

CrossFormer++:基于跨尺度注意力的通用视觉Transformer

计算机视觉与模式识别 2023-12-05 v2

摘要

尽管不同尺度的特征对视觉输入在感知上十分重要,现有视觉Transformer尚未显式利用它们。为此,我们首先提出一种跨尺度视觉Transformer——CrossFormer。它引入了跨尺度嵌入层(CEL)和长短距离注意力(LSDA)。一方面,CEL将每个令牌与多个不同尺度的图像块相融合,为自注意力模块本身提供跨尺度特征。另一方面,LSDA将自注意力模块拆分为短距离和长距离两部分,不仅降低了计算负担,还使令牌中同时保留小尺度和大尺度特征。此外,通过在CrossFormer上的实验,我们观察到影响视觉Transformer性能的另外两个问题,即自注意力图放大和幅度爆炸。因此,我们进一步提出渐进分组大小(PGS)范式和幅度冷却层(ACL)分别缓解这两个问题。融合PGS和ACL的CrossFormer称为CrossFormer++。大量实验表明,CrossFormer++在图像分类、目标检测、实例分割和语义分割任务上优于其他视觉Transformer。代码将发布于:https://github.com/cheerss/CrossFormer。

关键词

引用

@article{arxiv.2303.06908,
  title  = {CrossFormer++: A Versatile Vision Transformer Hinging on Cross-scale Attention},
  author = {Wenxiao Wang and Wei Chen and Qibo Qiu and Long Chen and Boxi Wu and Binbin Lin and Xiaofei He and Wei Liu},
  journal= {arXiv preprint arXiv:2303.06908},
  year   = {2023}
}

备注

16 pages, 7 figures