中文

Le-DETR:重新审视基于高效编码器设计的实时检测变换器

计算机视觉与模式识别 2026-02-25 v1

摘要

实时目标检测对于实际应用至关重要,因为其需要在保证高精度的同时实现低延迟。虽然检测变换器(DETR)已 demonstrated 显著的性能提升,但当前的实时 DETR 模型由于在主干网络上进行的大量预训练开销,使得从零开始复现困难,这限制了研究的进展,阻碍了对新颖主干网络架构的探索。在本文中,我们希望表明通过采用通用的优秀设计,完全可以在 **高性能** 与 **低预训练成本** 之间取得平衡。经过对主干架构的深入研究,我们提出了在 various尺度上 incorporat ing modern efficient convolution 和 local attention机制的 EfficientNAT。此外,我们重新设计了采用 local attention的混合编码器,显著提升了性能和推理速度。基于这些进展,我们提出了 Le-DETR(**L**ow-cost and **E**fficient **DE**tection **TR**ansformer),它仅使用 ImageNet1K 和 COCO2017 训练数据即可在实时检测方面实现新的 **SOTA**,在预训练阶段节省约 80% 的图像。我们展示了只要设计得当,实时 DETR 模型即可在无需复杂且计算密集型预训练的情况下实现卓越的性能。广泛的实验表明,Le-DETR-M/L/X 在 COCO Val2017 上的 **mAP** 分别为 **52.9/54.3/55.1**,在 RTX4090 上推理速度为 **4.45/5.01/6.68 ms**。它在保持类似速度的同时超越 YOLOv12-L/X by **+0.6/-0.1 mAP**,并实现 **+20%** 的加速。与 DEIM-D-FINE 比较,Le-DETR-M 实现 **+0.2 mAP**,推理速度略快;与 DEIM-D-FINE-L 相比,仅增加 **0.4 ms** 的延迟,却实现 **+0.4 mAP** 的提升。代码和模型权重将开源发布。

关键词

引用

@article{arxiv.2602.21010,
  title  = {Le-DETR: Revisiting Real-Time Detection Transformer with Efficient Encoder Design},
  author = {Jiannan Huang and Aditya Kane and Fengzhe Zhou and Yunchao Wei and Humphrey Shi},
  journal= {arXiv preprint arXiv:2602.21010},
  year   = {2026}
}

备注

CVPR Findings