CSWin Transformer:一种具有十字形窗口的通用视觉Transformer骨干网络
计算机视觉与模式识别
2022-01-11 v3 机器学习
摘要
我们提出CSWin Transformer,一种高效且有效的基于Transformer的通用视觉任务骨干网络。Transformer设计中的一个挑战性问题是全局自注意力计算代价非常高,而局部自注意力往往限制每个token的交互范围。为解决该问题,我们开发了十字形窗口(Cross-Shaped Window)自注意力机制,用于并行计算水平和垂直条带中的自注意力,这些条带构成一个十字形窗口,每个条带通过将输入特征分割为等宽条带获得。我们对条带宽度的效果进行了数学分析,并为Transformer网络的不同层改变条带宽度,从而在限制计算成本的同时实现强大的建模能力。我们还引入了局部增强位置编码(LePE),其比现有编码方案更好地处理局部位置信息。LePE自然支持任意输入分辨率,因此对于下游任务尤其有效且友好。结合这些设计以及分层结构,CSWin Transformer在常见视觉任务上展现出有竞争力的性能。具体而言,它在ImageNet-1K上无任何额外训练数据或标签时达到85.4%的Top-1准确率,在COCO检测任务上达到53.9 box AP和46.4 mask AP,在ADE20K语义分割任务上达到52.2 mIOU,在相似FLOPs设置下分别超越先前最先进的Swin Transformer骨干网络+1.2、+2.0、+1.4和+2.0。通过在更大数据集ImageNet-21K上进一步预训练,我们在ImageNet-1K上达到87.5%的Top-1准确率,并在ADE20K上以55.7 mIoU取得高分割性能。代码和模型可在 https://github.com/microsoft/CSWin-Transformer 获取。
引用
@article{arxiv.2107.00652,
title = {CSWin Transformer: A General Vision Transformer Backbone with Cross-Shaped Windows},
author = {Xiaoyi Dong and Jianmin Bao and Dongdong Chen and Weiming Zhang and Nenghai Yu and Lu Yuan and Dong Chen and Baining Guo},
journal= {arXiv preprint arXiv:2107.00652},
year = {2022}
}