探索用于目标检测的普通视觉 Transformer 骨干网络
计算机视觉与模式识别
2022-06-13 v2
摘要
我们探索将普通的、非层级的 Vision Transformer (ViT) 作为目标检测的骨干网络。该设计使得原始 ViT 架构无需为预训练重新设计层级骨干即可微调用于目标检测。通过极少的微调适配,我们的普通骨干检测器便能取得有竞争力的结果。令人惊讶地,我们观察到:(i) 从单尺度特征图构建简单特征金字塔(无需常见的 FPN 设计)已足够;(ii) 使用窗口注意力(无偏移)并辅以极少的跨窗口传播块已足够。利用作为 Masked Autoencoders (MAE) 预训练的普通 ViT 骨干,我们的检测器(命名为 ViTDet)可与先前所有基于层级骨干的领先方法竞争,仅使用 ImageNet-1K 预训练即在 COCO 数据集上达到最高 61.3 AP_box。我们希望我们的研究能引起对普通骨干检测器研究的关注。ViTDet 的代码已在 Detectron2 中提供。
引用
@article{arxiv.2203.16527,
title = {Exploring Plain Vision Transformer Backbones for Object Detection},
author = {Yanghao Li and Hanzi Mao and Ross Girshick and Kaiming He},
journal= {arXiv preprint arXiv:2203.16527},
year = {2022}
}
备注
Tech report. arXiv v2: add RetinaNet results