AuxDepthNet:基于深度敏感特征的实时单目三维目标检测
计算机视觉与模式识别
2025-01-08 v1 人工智能
摘要
由于单视图图像中缺乏显式的深度信息,单目三维目标检测是自主系统中一项具有挑战性的任务。现有方法通常依赖外部深度估计器或昂贵的传感器,这会增加计算复杂度并阻碍实时性能。为克服这些局限,我们提出了 AuxDepthNet,一种用于实时单目三维目标检测的高效框架,消除了对外部深度图或预训练深度模型的依赖。AuxDepthNet 引入了两个关键组件:辅助深度特征 (ADF) 模块,用于隐式学习深度敏感特征以提升空间推理和计算效率;以及深度位置映射 (DPM) 模块,将深度位置信息直接嵌入到检测过程中,从而实现精确的目标定位和三维边界框回归。借助 DepthFusion Transformer 架构,AuxDepthNet 通过深度引导的交互全局整合视觉特征与深度敏感特征,确保了稳健且高效的检测。在 KITTI 数据集上的大量实验表明,AuxDepthNet 取得了当前最优性能,在 IoU 阈值为 0.7 时, 得分分别为 24.72\%(简单)、18.63\%(中等)和 15.31\%(困难), 得分分别为 34.11\%(简单)、25.18\%(中等)和 21.90\%(困难)。
引用
@article{arxiv.2501.03700,
title = {AuxDepthNet: Real-Time Monocular 3D Object Detection with Depth-Sensitive Features},
author = {Ruochen Zhang and Hyeung-Sik Choi and Dongwook Jung and Phan Huy Nam Anh and Sang-Ki Jeong and Zihao Zhu},
journal= {arXiv preprint arXiv:2501.03700},
year = {2025}
}