CrossFormer++:基于跨尺度注意力的通用视觉Transformer
计算机视觉与模式识别
2023-12-05 v2
摘要
尽管不同尺度的特征对视觉输入在感知上十分重要,现有视觉Transformer尚未显式利用它们。为此,我们首先提出一种跨尺度视觉Transformer——CrossFormer。它引入了跨尺度嵌入层(CEL)和长短距离注意力(LSDA)。一方面,CEL将每个令牌与多个不同尺度的图像块相融合,为自注意力模块本身提供跨尺度特征。另一方面,LSDA将自注意力模块拆分为短距离和长距离两部分,不仅降低了计算负担,还使令牌中同时保留小尺度和大尺度特征。此外,通过在CrossFormer上的实验,我们观察到影响视觉Transformer性能的另外两个问题,即自注意力图放大和幅度爆炸。因此,我们进一步提出渐进分组大小(PGS)范式和幅度冷却层(ACL)分别缓解这两个问题。融合PGS和ACL的CrossFormer称为CrossFormer++。大量实验表明,CrossFormer++在图像分类、目标检测、实例分割和语义分割任务上优于其他视觉Transformer。代码将发布于:https://github.com/cheerss/CrossFormer。
引用
@article{arxiv.2303.06908,
title = {CrossFormer++: A Versatile Vision Transformer Hinging on Cross-scale Attention},
author = {Wenxiao Wang and Wei Chen and Qibo Qiu and Long Chen and Boxi Wu and Binbin Lin and Xiaofei He and Wei Liu},
journal= {arXiv preprint arXiv:2303.06908},
year = {2023}
}
备注
16 pages, 7 figures