中文

概率与几何深度:透视下的目标检测

计算机视觉与模式识别 2021-11-29 v3

摘要

3D 目标检测是驾驶辅助系统等多种实际应用所需的重要能力。单目 3D 检测作为基于图像方法中的代表性通用设定,比依赖 LiDARs 的传统设定更经济,但结果仍不尽如人意。本文首先对该问题进行了系统性研究。我们观察到,当前单目 3D 检测可简化为实例深度估计问题:不准确的实例深度阻碍了其他所有 3D 属性预测对整体检测性能的提升。此外,近期方法直接基于孤立实例或像素估计深度,忽略了不同对象间的几何关系。为此,我们构建跨预测对象的几何关系图,并利用该图辅助深度估计。由于在此不适定设定下各实例的初步深度估计通常不准确,我们引入概率表示以捕捉不确定性。其为识别可靠预测并进一步引导深度传播提供了重要指示。尽管基本思想简单,我们的方法 PGD 在 KITTI 与 nuScenes 基准上取得显著提升,在所有单目纯视觉方法中位列第一,同时保持实时效率。代码与模型将发布于 https://github.com/open-mmlab/mmdetection3d。

关键词

引用

@article{arxiv.2107.14160,
  title  = {Probabilistic and Geometric Depth: Detecting Objects in Perspective},
  author = {Tai Wang and Xinge Zhu and Jiangmiao Pang and Dahua Lin},
  journal= {arXiv preprint arXiv:2107.14160},
  year   = {2021}
}

备注

Conference on Robot Learning (CoRL) 2021