概率与几何深度:透视下的目标检测
计算机视觉与模式识别
2021-11-29 v3
摘要
3D 目标检测是驾驶辅助系统等多种实际应用所需的重要能力。单目 3D 检测作为基于图像方法中的代表性通用设定,比依赖 LiDARs 的传统设定更经济,但结果仍不尽如人意。本文首先对该问题进行了系统性研究。我们观察到,当前单目 3D 检测可简化为实例深度估计问题:不准确的实例深度阻碍了其他所有 3D 属性预测对整体检测性能的提升。此外,近期方法直接基于孤立实例或像素估计深度,忽略了不同对象间的几何关系。为此,我们构建跨预测对象的几何关系图,并利用该图辅助深度估计。由于在此不适定设定下各实例的初步深度估计通常不准确,我们引入概率表示以捕捉不确定性。其为识别可靠预测并进一步引导深度传播提供了重要指示。尽管基本思想简单,我们的方法 PGD 在 KITTI 与 nuScenes 基准上取得显著提升,在所有单目纯视觉方法中位列第一,同时保持实时效率。代码与模型将发布于 https://github.com/open-mmlab/mmdetection3d。
引用
@article{arxiv.2107.14160,
title = {Probabilistic and Geometric Depth: Detecting Objects in Perspective},
author = {Tai Wang and Xinge Zhu and Jiangmiao Pang and Dahua Lin},
journal= {arXiv preprint arXiv:2107.14160},
year = {2021}
}
备注
Conference on Robot Learning (CoRL) 2021