MonoNeRD:用于单目 3D 目标检测的类 NeRF 表示
计算机视觉与模式识别
2023-09-27 v2
摘要
在单目 3D 检测领域,利用场景几何线索来增强检测器性能是常见做法。然而,许多现有工作显式地采用这些线索,例如估计深度图并将其反投影到 3D 空间中。这种显式方法由于从 2D 到 3D 的维度增加而导致 3D 表示稀疏,并造成显著的信息损失,尤其是对于远处和被遮挡的物体。为缓解此问题,我们提出 MonoNeRD,一种能够推断密集 3D 几何与占据情况的新颖检测框架。具体而言,我们用有符号距离函数(SDF)对场景建模,从而促进密集 3D 表示的生成。我们将这些表示视为神经辐射场(NeRF),随后采用体渲染来恢复 RGB 图像与深度图。据我们所知,本工作是首个将体渲染引入 M3D 的,并展示了隐式重建用于基于图像的 3D 感知的潜力。在 KITTI-3D 基准与 Waymo Open Dataset 上进行的大量实验证明了 MonoNeRD 的有效性。代码见 https://github.com/cskkxjk/MonoNeRD。
引用
@article{arxiv.2308.09421,
title = {MonoNeRD: NeRF-like Representations for Monocular 3D Object Detection},
author = {Junkai Xu and Liang Peng and Haoran Cheng and Hao Li and Wei Qian and Ke Li and Wenxiao Wang and Deng Cai},
journal= {arXiv preprint arXiv:2308.09421},
year = {2023}
}
备注
Accepted by ICCV 2023