MS-DETR:基于混合监督的高效DETR训练
计算机视觉与模式识别
2024-01-09 v1
摘要
DETR通过基于图像特征迭代生成多个目标候选,并为每个真实目标推举一个候选,从而实现端到端的目标检测。原始DETR中使用一对一监督的传统训练过程缺乏对目标检测候选的直接监督。我们旨在通过混合一对一监督和一对多监督,显式地监督候选生成过程,从而提高DETR的训练效率。我们的方法,即MS-DETR,设计简洁,将一对多监督施加于用于推理的主解码器的目标查询上。与现有采用一对多监督的DETR变体(如Group DETR和Hybrid DETR)相比,我们的方法无需额外的解码器分支或目标查询。我们方法中主解码器的目标查询直接受益于一对多监督,因此在目标候选预测方面更为优越。实验结果表明,我们的方法优于相关的DETR变体,如DN-DETR、Hybrid DETR和Group DETR,并且与相关DETR变体的结合进一步提升了性能。
引用
@article{arxiv.2401.03989,
title = {MS-DETR: Efficient DETR Training with Mixed Supervision},
author = {Chuyang Zhao and Yifan Sun and Wenhao Wang and Qiang Chen and Errui Ding and Yi Yang and Jingdong Wang},
journal= {arXiv preprint arXiv:2401.03989},
year = {2024}
}