RT-DETRv3:基于分层密集正样本监督的实时端到端目标检测
计算机视觉与模式识别
2024-12-20 v3
摘要
RT-DETR 是首个基于 Transformer 的实时端到端目标检测器。其高效性源于框架设计和匈牙利匹配。然而,与 YOLO 系列等密集监督检测器相比,匈牙利匹配提供的监督要稀疏得多,导致模型训练不充分且难以达到最优结果。为了解决这些问题,我们基于 RT-DETR 提出了一种分层密集正样本监督方法,命名为 RT-DETRv3。首先,我们引入了一个基于 CNN 的辅助分支,它提供密集监督并与原始解码器协同工作以增强编码器特征表示。其次,为了解决解码器训练不充分的问题,我们提出了一种涉及自注意力扰动的新颖学习策略。该策略使多个查询组中正样本的标签分配多样化,从而丰富正样本监督。此外,我们引入了一个共享权重解码器分支用于密集正样本监督,以确保更多高质量查询与每个真实值相匹配。值得注意的是,上述所有模块仅用于训练。我们进行了大量实验以在 COCO val2017 上证明我们方法的有效性。RT-DETRv3 显著优于现有的实时检测器,包括 RT-DETR 系列和 YOLO 系列。例如,与 RT-DETR-R18/RT-DETRv2-R18 相比,RT-DETRv3-R18 在保持相同延迟的情况下实现了 48.1% AP (+1.6%/+1.4%)。此外,RT-DETRv3-R101 可达到令人瞩目的 54.6% AP,优于 YOLOv10-X。代码将发布于 https://github.com/clxia12/RT-DETRv3。
引用
@article{arxiv.2409.08475,
title = {RT-DETRv3: Real-time End-to-End Object Detection with Hierarchical Dense Positive Supervision},
author = {Shuo Wang and Chunlong Xia and Feng Lv and Yifeng Shi},
journal= {arXiv preprint arXiv:2409.08475},
year = {2024}
}