AnyDepth-DETR/-YOLO:使用单一网络实现任意深度目标检测
计算机视觉与模式识别
2026-05-12 v1
摘要
现代目标检测器是针对单一工作点优化的静态、固定深度网络,需要为不同的部署场景配备单独的模型。我们提出了一个任意深度检测框架,通过在推理时控制深度而无需重新训练,使单一网络能够跨越连续的精度-效率权衡范围。每个骨干网络和颈部阶段被划分为始终执行的核心路径和可跳过的细化路径;这种分解在每个深度配置下都保留了完整的多尺度特征层次结构,不同于丢弃整个阶段的传统提前退出机制。为了训练这样的网络,联合优化许多不同深度的子网络会引入冲突的梯度信号。我们通过仅在两个极端之间进行自蒸馏来解决这一问题,利用预测级和特征级对齐损失来强制逐阶段模块化,确保每个阶段的输出无论采取何种路径都保持兼容。在 RT-DETR 和 YOLOv12 上实例化后,我们的全深度配置以可忽略的参数开销匹配或超越了各自 SOTA 基线,而最高效的配置在仅损失 2.0 AP 的情况下实现了高达 的加速,所有这些均来自同一组权重。
引用
@article{arxiv.2605.09407,
title = {AnyDepth-DETR/-YOLO: Any-depth object detection with a single network},
author = {Woochul Kang and Hyungseop Lee and Jiho Lee},
journal= {arXiv preprint arXiv:2605.09407},
year = {2026}
}
备注
16 pages, 5 figures, 9 tables