中文

RT-DETRv4:利用视觉基础模型轻松提升实时目标检测

计算机视觉与模式识别 2025-10-30 v1

摘要

实时目标检测通过精心设计的网络结构和优化策略取得了显著进展。然而,追求高速推理的轻量化网络设计常常导致特征表示下降,进而阻碍性能进一步提升和实际设备部署。在本文中,我们提出一种成本效应高且高度可适应的蒸馏框架,利用不断进化的视觉基础模型(VFMs)来增强轻量级目标检测器。鉴于 VFMs 与资源受限检测器之间的显著架构和学习目标差异,实现稳定且任务对齐的语义传递颇具挑战。为此,我们一方面引入深度语义注入器(DSI)模块,促进 VFMs 的高层表征集成到检测器的深层结构中;另一方面,我们设计梯度引导自适应调制(GAM)策略,基于梯度范数比例动态调整语义传递强度。不增加部署和推理开销,我们的方法无缝地为各种基于 DETR 的模型带来显著且一致的性能提升,凸显其实际应用价值。我们的新模型族 RT-DETRv4 在 COCO 数据集上实现了最新成绩,分别以 49.7/53.5/55.4/57.0 的 AP 分数对应 273/169/124/78 FPS 的速度达成。

关键词

引用

@article{arxiv.2510.25257,
  title  = {RT-DETRv4: Painlessly Furthering Real-Time Object Detection with Vision Foundation Models},
  author = {Zijun Liao and Yian Zhao and Xin Shan and Yu Yan and Chang Liu and Lei Lu and Xiangyang Ji and Jie Chen},
  journal= {arXiv preprint arXiv:2510.25257},
  year   = {2025}
}