MonoPGC:基于像素几何上下文的单目三维目标检测
计算机视觉与模式识别
2023-02-22 v1
摘要
单目三维目标检测在自动驾驶中是一项经济但具挑战性的任务。近来基于中心点的单目方法在速度与精度之间取得了良好权衡而快速发展,它们通常依赖于通过2D特征估计物体中心深度。然而,缺乏充足像素几何信息的视觉语义特征可能影响空间三维检测任务线索的性能。为缓解此问题,我们提出MonoPGC,一种具有丰富像素几何上下文的新型端到端单目三维目标检测框架。我们引入像素深度估计作为辅助任务,并设计深度交叉注意力金字塔模块(DCPM)将局部与全局深度几何知识注入视觉特征。此外,我们提出深度空间感知Transformer(DSAT)以高效整合3D空间位置与深度感知特征。另外,我们设计了一种新颖的深度梯度位置编码(DGPE),为Transformer带来更鲜明的像素几何上下文以改进目标检测。大量实验表明,我们的方法在KITTI数据集上达到了最先进(SOTA)性能。
引用
@article{arxiv.2302.10549,
title = {MonoPGC: Monocular 3D Object Detection with Pixel Geometry Contexts},
author = {Zizhang Wu and Yuanzhu Gan and Lei Wang and Guilian Chen and Jian Pu},
journal= {arXiv preprint arXiv:2302.10549},
year = {2023}
}
备注
Accepted by ICRA 2023