面向高质量目标检测的 Rank-DETR
计算机视觉与模式识别
2023-11-06 v3 机器学习
摘要
现代检测 transformer(DETRs)使用一组目标查询来预测一系列边界框,按其分类置信度分数排序,并选取排名靠前的预测作为给定输入图像的最终检测结果。高性能目标检测器要求对边界框预测进行准确排序。对于基于 DETR 的检测器,由于分类分数与定位精度之间的错位,排名靠前的边界框存在定位精度不足的问题,从而阻碍了高质量检测器的构建。在本工作中,我们通过提出一系列面向排序的设计(统称为 Rank-DETR),引入了一种简单且高性能的基于 DETR 的目标检测器。我们的关键贡献包括:(i) 一种面向排序的架构设计,可促使正预测并抑制负预测,以确保更低的假阳性率;以及 (ii) 一种面向排序的损失函数和匹配代价设计,在排序时优先具有更准确定位精度的预测,从而提升高 IoU 阈值下的 AP。我们将该方法应用于改进近期的 SOTA 方法(如 H-DETR 和 DINO-DETR),并在使用 ResNet-、Swin-T 和 Swin-L 等不同骨干网络时报告了强劲的 COCO 目标检测结果,证明了我们方法的有效性。代码见 \url{https://github.com/LeapLabTHU/Rank-DETR}。
引用
@article{arxiv.2310.08854,
title = {Rank-DETR for High Quality Object Detection},
author = {Yifan Pu and Weicong Liang and Yiduo Hao and Yuhui Yuan and Yukang Yang and Chao Zhang and Han Hu and Gao Huang},
journal= {arXiv preprint arXiv:2310.08854},
year = {2023}
}
备注
NeurIPS 2023