中文

VFMM3D:利用视觉基础模型释放图像在单目 3D 目标检测中的潜力

计算机视觉与模式识别 2024-08-27 v2

摘要

由于其成本效益和广泛可用性,在推理期间仅依赖单个相机的单目 3D 目标检测在自动驾驶和机器人等各种应用中具有重要意义。然而,直接从单目图像预测 3D 空间中目标的坐标具有挑战性。因此,一种有效的解决方案是将单目图像转换为类 LiDAR 表示,并使用基于 LiDAR 的 3D 目标检测器来预测目标的 3D 坐标。该方法的关键步骤是将单目图像准确转换为可靠的点云形式。在本文中,我们提出了 VFMM3D,这是一个利用视觉基础模型的能力将单视图图像准确转换为 LiDAR 点云表示的创新框架。VFMM3D 利用 Segment Anything Model (SAM) 和 Depth Anything Model (DAM) 来生成富含前景信息的高质量伪 LiDAR 数据。具体而言,采用 Depth Anything Model (DAM) 生成密集深度图。随后,利用 Segment Anything Model (SAM) 通过预测实例掩码来区分前景和背景区域。然后将这些预测的实例掩码和深度图组合并投影到 3D 空间中,以生成伪 LiDAR 点。最后,可以利用任何基于点云的目标检测器来预测目标的 3D 坐标。在两个具有挑战性的 3D 目标检测数据集 KITTI 和 Waymo 上进行了综合实验。我们的 VFMM3D 在这两个数据集上均建立了新的 SOTA 性能。此外,实验结果证明了 VFMM3D 的通用性,展示了其能够无缝集成到各种基于 LiDAR 的 3D 目标检测器中。

关键词

引用

@article{arxiv.2404.09431,
  title  = {VFMM3D: Releasing the Potential of Image by Vision Foundation Model for Monocular 3D Object Detection},
  author = {Bonan Ding and Jin Xie and Jing Nie and Jiale Cao and Xuelong Li and Yanwei Pang},
  journal= {arXiv preprint arXiv:2404.09431},
  year   = {2024}
}

备注

11 pages, 4 figures