中文

SG-Former:具有演化令牌重分配的自引导Transformer

计算机视觉与模式识别 2023-08-24 v1

摘要

Vision Transformer已在各类视觉任务中展现出令人印象深刻的成效。然而,其随令牌序列长度呈二次增长的计算开销,极大限制了其在处理大特征图时的能力。为缓解计算成本,已有工作要么依赖局限于局部小区域的细粒度自注意力,要么采用全局自注意力但缩短序列长度从而导致粗粒度。本文提出一种新颖模型,称为自引导Transformer(SG-Former),旨在实现具有自适应细粒度的有效全局自注意力。我们方法的核心是利用显著性图,该图通过混合尺度自注意力估计并在训练中自我演化,以基于各区域显著性重分配令牌。直观上,我们为显著区域分配更多令牌以实现细粒度注意力,同时为次要区域分配较少令牌以换取效率与全局感受野。所提SG-Former取得了优于当前最优的性能:我们的基础尺寸模型在ImageNet-1K上达到84.7% Top-1准确率,在CoCo上达到51.2mAP bbAP,在ADE20K上达到52.7mIoU,分别超越Swin Transformer +1.3% / +2.7 mAP / +3 mIoU,且计算成本更低、参数更少。代码见https://github.com/OliverRensu/SG-Former

关键词

引用

@article{arxiv.2308.12216,
  title  = {SG-Former: Self-guided Transformer with Evolving Token Reallocation},
  author = {Sucheng Ren and Xingyi Yang and Songhua Liu and Xinchao Wang},
  journal= {arXiv preprint arXiv:2308.12216},
  year   = {2023}
}

备注

Accepted by ICCV 2023