重新审视DETR用于目标检测的自监督预训练
计算机视觉与模式识别
2023-12-04 v2
摘要
受基于DETR的方法在COCO目标检测与分割基准上显著成就的推动,近期研究致力于在保持骨干网络冻结的同时通过对Transformers进行自监督预训练来提升其性能。若干研究记录了精度的显著进展。我们深入探究了一种代表性方法DETReg,及其在-Deformable-DETR等新兴模型下的性能评估。遗憾的是,在全数据条件下DETReg不足以提升鲁棒DETR基模型的性能。为剖析根源,我们在COCO与PASCAL VOC上开展了大量实验,探究预训练数据集选择及预训练目标生成策略等要素。相比之下,我们采用名为Simple Self-training的优化方法,通过改进框预测器与Objects基准的结合带来明显提升。上述努力最终在COCO val集上取得的卓越AP分数,较无预训练的-Deformable-DETR + Swin-L高出。此外,由融合当代图像到文本(LLaVA)与文本到图像(SDXL)模型生成的一系列合成预训练数据集,显著增强了目标检测能力。
引用
@article{arxiv.2308.01300,
title = {Revisiting DETR Pre-training for Object Detection},
author = {Yan Ma and Weicong Liang and Bohan Chen and Yiduo Hao and Bojian Hou and Xiangyu Yue and Chao Zhang and Yuhui Yuan},
journal= {arXiv preprint arXiv:2308.01300},
year = {2023}
}