基于掩码图像建模释放 vanilla Vision Transformer 在目标检测中的潜力
计算机视觉与模式识别
2022-05-20 v2
摘要
我们提出了一种高效且有效地将掩码图像建模(MIM)预训练的 vanilla Vision Transformer(ViT)适配于目标检测的方法,该方法基于我们的两个新观察:(i)一个 MIM 预训练的 vanilla ViT 编码器即使在具有随机采样部分观测的具有挑战性的目标级识别场景中也能出奇地表现良好,例如仅使用输入嵌入的 25% 50%。(ii)为了从单尺度 ViT 构建用于目标检测的多尺度表示,一个随机初始化的紧凑卷积 stem 取代了预训练的大核 patchify stem,且其中间特征可自然地作为特征金字塔网络更高分辨率输入,而无需进一步上采样或其他操作。虽然预训练的 ViT 仅被视为我们检测器骨干的第 3 阶段而非整个特征提取器。这产生了一个 ConvNet-ViT 混合特征提取器。所提出的检测器名为 MIMDet,使 MIM 预训练的 vanilla ViT 在 COCO 上以 2.5 box AP 和 2.6 mask AP 优于分层 Swin Transformer,并与之前最佳的适配 vanilla ViT 检测器相比,在使用更温和的微调方案的同时取得更好结果,且收敛速度快 2.8。代码和预训练模型可在 https://github.com/hustvl/MIMDet 获取。
引用
@article{arxiv.2204.02964,
title = {Unleashing Vanilla Vision Transformer with Masked Image Modeling for Object Detection},
author = {Yuxin Fang and Shusheng Yang and Shijie Wang and Yixiao Ge and Ying Shan and Xinggang Wang},
journal= {arXiv preprint arXiv:2204.02964},
year = {2022}
}
备注
v2: more analysis & stronger results. Preprint. Work in progress. Code and pre-trained models are available at https://github.com/hustvl/MIMDet