MonoDETR:用于单目三维目标检测的深度引导Transformer
计算机视觉与模式识别
2025-02-14 v5 人工智能
图像与视频处理
摘要
单目三维目标检测长期以来一直是自动驾驶中的一项挑战性任务。大多数现有方法遵循传统的二维检测器,首先定位目标中心,然后通过邻近特征预测三维属性。然而,仅使用局部视觉特征不足以理解场景级的三维空间结构,并忽略了长程目标间深度关系。在本文中,我们引入了首个用于单目检测的深度引导Transformer DETR框架,命名为MonoDETR。我们将原始Transformer修改为深度感知的,并通过上下文深度线索引导整个检测过程。具体而言,在与捕获目标外观的视觉编码器并行的情况下,我们引入预测前景深度图,并专门设计深度编码器以提取非局部深度嵌入。然后,我们将三维目标候选表示为可学习查询,并提出深度引导解码器来进行目标-场景深度交互。通过这种方式,每个目标查询从图像上的深度引导区域自适应地估计其三维属性,不再受限于局部视觉特征。在以单目图像为输入的KITTI基准上,MonoDETR取得了最先进的性能,且不需要额外的密集深度标注。此外,我们的深度引导模块还可以即插即用地增强nuScenes数据集上的多视角三维目标检测器,展示了我们优越的泛化能力。代码可在 https://github.com/ZrrSkywalker/MonoDETR 获取。
引用
@article{arxiv.2203.13310,
title = {MonoDETR: Depth-guided Transformer for Monocular 3D Object Detection},
author = {Renrui Zhang and Han Qiu and Tai Wang and Ziyu Guo and Yiwen Tang and Xuanzhuo Xu and Ziteng Cui and Yu Qiao and Peng Gao and Hongsheng Li},
journal= {arXiv preprint arXiv:2203.13310},
year = {2025}
}
备注
Accepted by ICCV 2023. Code is available at https://github.com/ZrrSkywalker/MonoDETR