中文

基于多尺度令牌聚合的分流自注意力

计算机视觉与模式识别 2022-04-14 v2

摘要

近期的 Vision Transformer(ViT)模型已在各类计算机视觉任务中展现出令人鼓舞的结果,这归功于其通过自注意力对图像块或令牌的长程依赖建模能力。然而,这些模型通常在每一层内为每个令牌特征指定相似的感受野。这一限制不可避免地制约了各自注意力层捕获多尺度特征的能力,从而导致在处理含不同尺度多个物体的图像时性能下降。为解决此问题,我们提出一种新颖且通用的策略,称为分流自注意力(SSA),其允许 ViT 在每个注意力层以混合尺度建模注意力。SSA 的核心思想是将异构感受野尺寸注入令牌:在计算自注意力矩阵前,它有选择地合并令牌以表示更大的物体特征,同时保留某些令牌以维持细粒度特征。这一新颖合并方案使自注意力能学习不同大小物体间的关系,并同时减少令牌数量与计算开销。跨多项任务的大量实验证明了 SSA 的优越性。具体而言,基于 SSA 的 transformer 在 ImageNet 上以仅一半的模型规模与计算开销取得了 84.0% 的 Top-1 准确率,优于最先进的 Focal Transformer,并在相似参数与计算开销下于 COCO 上超越 Focal Transformer 1.3 mAP、于 ADE20K 上超越 2.9 mIOU。代码已发布于 https://github.com/OliverRensu/Shunted-Transformer。

关键词

引用

@article{arxiv.2111.15193,
  title  = {Shunted Self-Attention via Multi-Scale Token Aggregation},
  author = {Sucheng Ren and Daquan Zhou and Shengfeng He and Jiashi Feng and Xinchao Wang},
  journal= {arXiv preprint arXiv:2111.15193},
  year   = {2022}
}

备注

CVPR2022 Oral