中文

全局上下文视觉Transformer

计算机视觉与模式识别 2023-06-07 v5 人工智能 机器学习

摘要

我们提出全局上下文视觉Transformer(GC ViT),一种提升计算机视觉中参数与计算利用率的新架构。我们的方法利用全局上下文自注意力模块,与标准局部自注意力联合,有效且高效地建模长程与短程空间交互,无需诸如计算注意力掩码或平移局部窗口等昂贵操作。此外,我们针对ViT中归纳偏置的缺失,提出在架构中采用改进的融合倒残差块。我们提出的GC ViT在图像分类、目标检测与语义分割任务上均取得最先进(SOTA)结果。在ImageNet-1K分类数据集中,参数量为51M、90M与201M的GC ViT变体在224图像分辨率且无需任何预训练下分别达到84.3%、85.0%与85.7%的Top-1准确率,从而大幅超越同等规模的先前工作,如基于CNN的ConvNeXt与基于ViT的MaxViT和Swin Transformer。使用MS COCO与ADE20K数据集在目标检测、实例分割与语义分割下游任务中预训练的GC ViT骨干网络一致优于先前工作。具体而言,采用4尺度DINO检测头的GC ViT在MS COCO数据集上取得58.3的框AP。

关键词

引用

@article{arxiv.2206.09959,
  title  = {Global Context Vision Transformers},
  author = {Ali Hatamizadeh and Hongxu Yin and Greg Heinrich and Jan Kautz and Pavlo Molchanov},
  journal= {arXiv preprint arXiv:2206.09959},
  year   = {2023}
}

备注

Accepted to ICML 2023