MoGDE:利用地面深度估计提升移动端单目 3D 目标检测
计算机视觉与模式识别
2023-03-27 v1
摘要
移动场景(如车载、无人机或机器人)中的单目 3D 目标检测(Mono3D)是一项重要且具有挑战性的任务。由于单目视觉的远近视差现象及不断变化的相机位姿,难以获得高检测精度,尤其是对远处物体。受“物体深度可根据其所在地面深度良好确定”的启发,本文提出一种名为 MoGDE 的新型 Mono3D 框架,其持续估计图像对应地面深度,并利用估计的地面深度信息引导 Mono3D。为此,我们利用位姿检测网络估计相机位姿,再根据 3D 到 2D 透视几何构建描绘像素级地面深度的特征图。此外,为利用估计地面深度改进 Mono3D,我们设计了基于 transformer 结构的 RGB-D 特征融合网络,其中利用长程自注意力机制有效识别接地点并将相应地面深度锚定到图像特征图。我们在真实世界 KITTI 数据集上进行了大量实验。结果表明,MoGDE 能有效提升近处与远处物体的 Mono3D 精度与鲁棒性。MoGDE 以较大优势优于最先进方法,取得最佳性能,并在 KITTI 3D 基准上排名第一。
引用
@article{arxiv.2303.13561,
title = {MoGDE: Boosting Mobile Monocular 3D Object Detection with Ground Depth Estimation},
author = {Yunsong Zhou and Quan Liu and Hongzi Zhu and Yunzhe Li and Shan Chang and Minyi Guo},
journal= {arXiv preprint arXiv:2303.13561},
year = {2023}
}
备注
36th Conference on Neural Information Processing Systems (NeurIPS), 2022. arXiv admin note: text overlap with arXiv:2303.13018