基于伪 LiDAR 点云的单目 3D 目标检测
计算机视觉与模式识别
2019-09-04 v4
摘要
单目 3D 场景理解任务,如目标尺寸估计、朝向角估计和 3D 定位,具有挑战性。现代成功的 3D 场景理解方法需要使用 3D 传感器。另一方面,基于单图像的方法性能明显较差。在这项工作中,我们旨在通过增强基于 LiDAR 的算法以处理单图像输入,来弥合 3D 感知与 2D 感知在 3D 目标检测上的性能差距。具体而言,我们执行单目深度估计,并将输入图像提升为点云表示,我们将其称为伪 LiDAR 点云。然后我们可以用我们的伪 LiDAR 端到端地训练基于 LiDAR 的 3D 检测网络。遵循两阶段 3D 检测算法的流程,我们在输入图像中检测 2D 目标候选框,并为每个候选框从伪 LiDAR 中提取点云视锥。然后为每个视锥检测一个有向 3D 边界框。为了处理伪 LiDAR 中的大量噪声,我们提出了两项创新:(1)使用 2D-3D 边界框一致性约束,调整预测的 3D 边界框,使其在投影到图像上后与对应的 2D 候选框具有高重叠度;(2)使用实例掩码而非边界框作为 2D 候选框的表示,以减少点云视锥中不属于目标的点的数量。通过在 KITTI 基准上的评估,我们在所有单目方法中的鸟瞰图和 3D 目标检测均取得了最高排名的性能,将先前 SOTA 的性能有效提升了四倍。我们的代码可在 https://github.com/xinshuoweng/Mono3D_PLiDAR 获取。
引用
@article{arxiv.1903.09847,
title = {Monocular 3D Object Detection with Pseudo-LiDAR Point Cloud},
author = {Xinshuo Weng and Kris Kitani},
journal= {arXiv preprint arXiv:1903.09847},
year = {2019}
}
备注
Camera Ready for ICCV Workshop on "Road Scene Understanding and Autonomous Driving"