DEYOv3:结合 YOLO 的 DETR 实时目标检测模型
计算机视觉与模式识别
2023-09-26 v2
摘要
近来,端到端目标检测器因其卓越性能受到研究界的显著关注。然而,DETR 通常依赖于在 ImageNet 上对骨干网络进行监督预训练,这限制了 DETR 的实际应用与骨干网络设计,影响了模型的潜在泛化能力。本文提出一种称为逐步训练的新训练方法。具体而言,在第一阶段,使用一对多预训练的 YOLO 检测器来初始化端到端检测器。在第二阶段,骨干网络与编码器与类 DETR 模型一致,但仅需从零训练检测器。由于该训练方法,目标检测器无需额外数据集(ImageNet)来训练骨干网络,使骨干网络设计更为灵活,并大幅降低检测器的训练成本,有助于目标检测器的实际应用。同时,相较类 DETR 模型,逐步训练方法可比类 DETR 模型的传统训练方法达到更高精度。借助这一新颖训练方法,我们提出一种全新的端到端实时目标检测模型 DEYOv3。DEYOv3-N 在 COCO val2017 上达到 41.1% 精度,在 T4 GPU 上达到 270 FPS,而 DEYOv3-L 达到 51.3% AP 与 102 FPS。在不使用额外训练数据的情况下,DEYOv3 在速度与精度上均超越所有现有实时目标检测器。值得注意的是,对于 N、S 和 M 规模的模型,在 COCO 数据集上的训练可使用单块 24GB RTX3090 GPU 完成。代码将发布于 https://github.com/ouyanghaodong/DEYOv3。
引用
@article{arxiv.2309.11851,
title = {DEYOv3: DETR with YOLO for Real-time Object Detection},
author = {Haodong Ouyang},
journal= {arXiv preprint arXiv:2309.11851},
year = {2023}
}
备注
Work in progress