中文

RenderOcc:基于二维渲染监督的视觉中心三维占据预测

计算机视觉与模式识别 2024-03-05 v2

摘要

三维占据预测在机器人感知与自动驾驶领域具有重要前景,其将三维场景量化为带语义标签的栅格单元。现有工作主要利用三维体素空间中的完整占据标签进行监督。然而,昂贵的标注过程以及有时模糊的标签严重制约了三维占据模型的可用性与可扩展性。为此,我们提出 RenderOcc,一种仅使用二维标签训练三维占据模型的新范式。具体而言,我们从多视角图像中提取 NeRF 风格的三维体表示,并采用体渲染技术建立二维渲染,从而实现对二维语义与深度标签的直接三维监督。此外,我们引入辅助射线方法以应对自动驾驶场景中视角稀疏的问题,其利用连续帧为每个物体构建完整的二维渲染。据我们所知,RenderOcc 是首个仅使用二维标签训练多视角三维占据模型的尝试,降低了对昂贵三维占据标注的依赖。大量实验表明,RenderOcc 取得了与使用三维标签全监督的模型相当的性能,凸显了该方法的实际应用价值。

关键词

引用

@article{arxiv.2309.09502,
  title  = {RenderOcc: Vision-Centric 3D Occupancy Prediction with 2D Rendering Supervision},
  author = {Mingjie Pan and Jiaming Liu and Renrui Zhang and Peixiang Huang and Xiaoqi Li and Bing Wang and Hongwei Xie and Li Liu and Shanghang Zhang},
  journal= {arXiv preprint arXiv:2309.09502},
  year   = {2024}
}