用于视觉Transformer中局部-全局交互的聚焦自注意力
计算机视觉与模式识别
2021-07-02 v1 人工智能
机器学习
摘要
最近,Vision Transformer及其变体在各种计算机视觉任务上显示出巨大前景。通过自注意力捕获短程和长程视觉依赖的能力可以说是成功的主要来源。但这也带来了由于二次计算开销带来的挑战,特别是对于高分辨率视觉任务(例如目标检测)。在本文中,我们提出聚焦自注意力,一种结合细粒度局部和粗粒度全局交互的新机制。使用这一新机制,每个token以细粒度关注最近周围token,而以粗粒度关注远处token,从而能够高效且有效地捕获短程和长程视觉依赖。借助聚焦自注意力,我们提出了一种称为Focal Transformer的Vision Transformer模型新变体,其在一系列公开图像分类和目标检测基准上取得了优于最先进视觉Transformers的性能。特别地,我们具有51.1M中等规模和89.8M较大规模的Focal Transformer模型在224x224分辨率ImageNet分类上分别达到83.5和83.8的Top-1准确率。使用Focal Transformers作为骨干网络,我们在使用标准1x和3x调度训练的6种不同目标检测方法上相对于当前最先进的Swin Transformers获得一致且实质性的改进。我们最大的Focal Transformer在COCO mini-val/test-dev上产生58.7/58.9 box mAPs和50.9/51.3 mask mAPs,在ADE20K上产生55.4 mIoU用于语义分割,在三个最具挑战性的计算机视觉任务上创造了新的SOTA。
引用
@article{arxiv.2107.00641,
title = {Focal Self-attention for Local-Global Interactions in Vision Transformers},
author = {Jianwei Yang and Chunyuan Li and Pengchuan Zhang and Xiyang Dai and Bin Xiao and Lu Yuan and Jianfeng Gao},
journal= {arXiv preprint arXiv:2107.00641},
year = {2021}
}