Frozen-DETR:利用冻结基础模型的图像理解增强 DETR
计算机视觉与模式识别
2024-10-28 v1
摘要
近期的视觉基础模型能够提取通用表示,并在各种任务中展现出令人印象深刻的能力。然而,它们在目标检测中的应用很大程度上被忽视了,尤其是在不对它们进行微调的情况下。在这项工作中,我们表明冻结的基础模型可以作为一种通用的特征增强器,即使它们并未针对目标检测进行预训练。具体而言,我们探索了通过以下两种方式将基础模型的高层图像理解直接迁移到检测器中。首先,基础模型中的 class token 提供了对复杂场景的深入理解,通过提供紧凑的上下文,这有助于在检测器的解码器中解码目标查询。此外,基础模型中的 patch tokens 可以通过提供语义细节来丰富检测器编码器中的特征。将冻结的基础模型作为即插即用模块,而不是常用的主干网络,可以显著增强检测器的性能,同时避免由检测器主干网络与基础模型之间的架构差异引起的问题。采用这种新范式,在 COCO 验证集上以 R50 作为检测器主干网络训练 12 个 epoch 后,我们将 SOTA 基于查询的检测器 DINO 从 49.0% AP 提升至 51.9% AP(+2.9% AP),并通过分别集成一个或两个基础模型进一步提升至 53.8% AP(+4.8% AP)。
引用
@article{arxiv.2410.19635,
title = {Frozen-DETR: Enhancing DETR with Image Understanding from Frozen Foundation Models},
author = {Shenghao Fu and Junkai Yan and Qize Yang and Xihan Wei and Xiaohua Xie and Wei-Shi Zheng},
journal= {arXiv preprint arXiv:2410.19635},
year = {2024}
}
备注
Accepted to NeurIPS 2024