OccLE:标签高效的3D语义占据预测
计算机视觉与模式识别
2026-01-23 v4
摘要
3D 语义占据预测提供了直观且高效的场景理解,已在自动驾驶感知领域引起广泛关注。现有方法要么依赖完全监督,需要高成本的体素级标注,要么依赖自监督,提供的指导有限且性能次优。为此,我们提出了 OccLE,这是一种标签高效的3D语义占据预测方法,接受图像和 LiDAR 作为输入,仅凭有限的体素标注即可保持高性能。我们的直觉是解耦语义和几何学习任务,然后融合来自两种任务的学习特征网格,用于最终的语义占据预测。因此,语义分支通过蒸馏2D基础模型,为2D和3D语义学习提供对齐的伪标签。几何分支基于其内在特性,在平面内整合图像和 LiDAR 输入,采用半监督方式以增强几何学习。我们通过 Dual Mamba 融合语义-几何特征网格,并采用散布-累积投影,以对齐的伪标签监督未标注的预测。实验表明,OccLE 在 SemanticKITTI 和 Occ3D-nuScenes 数据集上仅使用 10% 的体素标注即可实现竞争性能。代码将在 https://github.com/NerdFNY/OccLE 上公开发布。
引用
@article{arxiv.2505.20617,
title = {OccLE: Label-Efficient 3D Semantic Occupancy Prediction},
author = {Naiyu Fang and Zheyuan Zhou and Fayao Liu and Xulei Yang and Jiacheng Wei and Lemiao Qiu and Hongsheng Li and Guosheng Lin},
journal= {arXiv preprint arXiv:2505.20617},
year = {2026}
}