中文

Easy3D-Labels:使用三维伪标签监督语义占用估计以用于汽车感知

计算机视觉与模式识别 2026-03-27 v4

摘要

在自动驾驶汽车的感知中,安全不仅对驾驶员至关重要,对场景中的其他智能体,特别是行人和骑行者等弱势道路使用者同样关键。以往的表示方法,如鸟瞰图,会压缩垂直信息,导致三维物体定位模糊,并限制了对环境的准确理解,从而影响运动规划和场景预测等下游任务。相比之下,语义占用提供了周围环境的完整三维表示,解决了这些局限性。此外,自监督语义占用在自动驾驶汽车领域受到越来越多的关注。与依赖人工标注数据的监督方法不同,这些方法使用二维伪标签,通过减少对劳动密集型标注的需求来提高可扩展性。因此,此类模型采用新视角合成、跨视角渲染和深度估计等技术,以允许根据二维标签进行模型监督。然而,这类方法在训练期间通常会产生高昂的计算和内存成本,尤其是对于新视角合成。为了解决这些问题,我们提出了Easy3D-Labels,即使用Grounded-SAM和Metric3Dv2生成的,并通过时间聚合进行稠密化的三维伪真实标签,允许直接在三维空间中进行监督。Easy3D-Labels可以轻松集成到现有模型中提供模型监督,从而产生显著的性能提升,当应用于OccNeRF时,在Occ3D-nuScenes数据集上,mIoU提高了45%,RayIoU提高了49%。此外,我们引入了EasyOcc,这是一个仅在这些三维伪标签上训练的简化模型,避免了复杂的渲染策略,并在Occ3D-nuScenes上达到了15.7的mIoU。Easy3D-Labels通过减少物体重复并提高深度估计精度来改善场景理解。

关键词

引用

@article{arxiv.2509.26087,
  title  = {Easy3D-Labels: Supervising Semantic Occupancy Estimation with 3D Pseudo-Labels for Automotive Perception},
  author = {Seamie Hayes and Ganesh Sistu and Tim Brophy and Ciaran Eising},
  journal= {arXiv preprint arXiv:2509.26087},
  year   = {2026}
}