Pale Transformer:一种具有 Pale 形注意力的通用视觉 Transformer 骨干网络
计算机视觉与模式识别
2021-12-30 v1
摘要
近来,Transformers 在各种视觉任务中展现出有前景的性能。为降低全局自注意力带来的二次计算复杂度,各类方法将注意力范围限制于局部区域以提升效率。因此,它们在单一注意力层中的感受野不够大,导致上下文建模不足。为解决此问题,我们提出 Pale 形自注意力(PS-Attention),其在 pale 形区域内执行自注意力。与全局自注意力相比,PS-Attention 能显著降低计算与内存开销。同时,在与此前局部自注意力机制相近的计算复杂度下,它能捕获更丰富的上下文信息。基于 PS-Attention,我们开发了具有分层架构的通用 Vision Transformer 骨干网络,名为 Pale Transformer,在 224 的 ImageNet-1K 分类任务中,模型规模分别为 22M、48M 和 85M 时取得了 83.4%、84.3% 和 84.9% 的 Top-1 准确率,优于此前的 Vision Transformer 骨干网络。对于下游任务,我们的 Pale Transformer 骨干网络在 ADE20K 语义分割与 COCO 目标检测及实例分割上,比近期最先进的 CSWin Transformer 大幅领先。代码将发布于 https://github.com/BR-IDL/PaddleViT。
引用
@article{arxiv.2112.14000,
title = {Pale Transformer: A General Vision Transformer Backbone with Pale-Shaped Attention},
author = {Sitong Wu and Tianyi Wu and Haoru Tan and Guodong Guo},
journal= {arXiv preprint arXiv:2112.14000},
year = {2021}
}