SelfOcc:基于自监督视觉的 3D 占据预测
计算机视觉与模式识别
2023-11-30 v2 人工智能
机器学习
摘要
3D 占据预测对于以视觉为中心的自动驾驶的鲁棒性是一项重要任务,其旨在预测周围 3D 空间中每个点是否被占据。现有方法通常需要 3D 占据标签以产生有意义的结果。然而,标注每个体素的占据状态非常费力。本文中,我们提出 SelfOcc 以探索仅使用视频序列学习 3D 占据的自监督方法。我们首先将图像变换到 3D 空间(如鸟瞰图)以获得场景的 3D 表示。我们直接将 3D 表示作为有符号距离场施加约束。随后我们可渲染先前与未来帧的 2D 图像作为自监督信号来学习 3D 表示。我们提出一种嵌入 MVS 的策略,以利用多个深度提议直接优化 SDF 诱导的权重。我们的 SelfOcc 在 SemanticKITTI 上使用单帧作为输入时比先前最佳方法 SceneRF 高出 58.7%,并且是首个在 nuScenes 上为环视相机生成合理 3D 占据的自监督工作。SelfOcc 生成高质量深度,并在 SemanticKITTI、KITTI-2015 和 nuScenes 上分别取得新颖深度合成、单目深度估计和环视深度估计的最先进结果。代码:https://github.com/huang-yh/SelfOcc。
引用
@article{arxiv.2311.12754,
title = {SelfOcc: Self-Supervised Vision-Based 3D Occupancy Prediction},
author = {Yuanhui Huang and Wenzhao Zheng and Borui Zhang and Jie Zhou and Jiwen Lu},
journal= {arXiv preprint arXiv:2311.12754},
year = {2023}
}
备注
Code is available at: https://github.com/huang-yh/SelfOcc