中文

探索用于目标检测的普通视觉 Transformer 骨干网络

计算机视觉与模式识别 2022-06-13 v2

摘要

我们探索将普通的、非层级的 Vision Transformer (ViT) 作为目标检测的骨干网络。该设计使得原始 ViT 架构无需为预训练重新设计层级骨干即可微调用于目标检测。通过极少的微调适配,我们的普通骨干检测器便能取得有竞争力的结果。令人惊讶地,我们观察到:(i) 从单尺度特征图构建简单特征金字塔(无需常见的 FPN 设计)已足够;(ii) 使用窗口注意力(无偏移)并辅以极少的跨窗口传播块已足够。利用作为 Masked Autoencoders (MAE) 预训练的普通 ViT 骨干,我们的检测器(命名为 ViTDet)可与先前所有基于层级骨干的领先方法竞争,仅使用 ImageNet-1K 预训练即在 COCO 数据集上达到最高 61.3 AP_box。我们希望我们的研究能引起对普通骨干检测器研究的关注。ViTDet 的代码已在 Detectron2 中提供。

关键词

引用

@article{arxiv.2203.16527,
  title  = {Exploring Plain Vision Transformer Backbones for Object Detection},
  author = {Yanghao Li and Hanzi Mao and Ross Girshick and Kaiming He},
  journal= {arXiv preprint arXiv:2203.16527},
  year   = {2022}
}

备注

Tech report. arXiv v2: add RetinaNet results