中文

ShelfOcc:面向基于视觉的占用估计的原生3D监督技术

计算机视觉与模式识别 2025-11-20 v1

摘要

最近的自监督和弱监督占用估计进展主要依赖于2D投影或渲染式监督,存在几何不一致和严重深度漂移问题。我们因此引入ShelfOcc,一种无需激光雷达即可克服这些限制的视觉唯一方法。ShelfOcc通过从视频生成度量一致的语义体素标签,将监督引入原生3D空间,从而实现无任何额外传感器或手动3D标注的真正3D监督。虽然近期基于视觉的3D几何基础模型提供了可行的先验知识,但其稀疏或噪声且不一致的几何(尤其是在动态驾驶场景中)无法直接用于预测。我们的方法引入专用框架,通过跨帧一致过滤和累积静态几何、处理动态内容并将语义信息传递到稳定的体素表示中来缓解这些问题。这种对弱/货架监督占用估计的感官导向转变,使得本可使用几乎任何SOTA占用模型架构,而无需依赖激光雷达数据。我们认为,这种高质量监督对稳健的占用学习至关重要,构成了重要的补充路径。我们在Occ3D-nuScenes基准上,ShelfOcc显著优于所有以前的弱/货架监督方法(提升最高达34%),建立了LiDAR-free 3D场景理解的数据驱动方向。

关键词

引用

@article{arxiv.2511.15396,
  title  = {ShelfOcc: Native 3D Supervision beyond LiDAR for Vision-Based Occupancy Estimation},
  author = {Simon Boeder and Fabian Gigengack and Simon Roesler and Holger Caesar and Benjamin Risse},
  journal= {arXiv preprint arXiv:2511.15396},
  year   = {2025}
}