SG-Former:具有演化令牌重分配的自引导Transformer
计算机视觉与模式识别
2023-08-24 v1
摘要
Vision Transformer已在各类视觉任务中展现出令人印象深刻的成效。然而,其随令牌序列长度呈二次增长的计算开销,极大限制了其在处理大特征图时的能力。为缓解计算成本,已有工作要么依赖局限于局部小区域的细粒度自注意力,要么采用全局自注意力但缩短序列长度从而导致粗粒度。本文提出一种新颖模型,称为自引导Transformer(SG-Former),旨在实现具有自适应细粒度的有效全局自注意力。我们方法的核心是利用显著性图,该图通过混合尺度自注意力估计并在训练中自我演化,以基于各区域显著性重分配令牌。直观上,我们为显著区域分配更多令牌以实现细粒度注意力,同时为次要区域分配较少令牌以换取效率与全局感受野。所提SG-Former取得了优于当前最优的性能:我们的基础尺寸模型在ImageNet-1K上达到84.7% Top-1准确率,在CoCo上达到51.2mAP bbAP,在ADE20K上达到52.7mIoU,分别超越Swin Transformer +1.3% / +2.7 mAP / +3 mIoU,且计算成本更低、参数更少。代码见https://github.com/OliverRensu/SG-Former
引用
@article{arxiv.2308.12216,
title = {SG-Former: Self-guided Transformer with Evolving Token Reallocation},
author = {Sucheng Ren and Xingyi Yang and Songhua Liu and Xinchao Wang},
journal= {arXiv preprint arXiv:2308.12216},
year = {2023}
}
备注
Accepted by ICCV 2023