SDGOCC:面向 3D 多模态占据预测的语义与深度引导的鸟瞰视角变换
计算机视觉与模式识别
2025-07-24 v1 人工智能
摘要
3D 多模态占据预测因其在自动驾驶领域的潜力受到广泛关注。然而,现有大多数方法都为单模态:基于相机的方法缺乏深度信息,而基于 LiDAR 的方法则难以处理遮挡。当前的轻量级方法主要依赖升力-碾压-射击(LSS)流水线, suffers from depth 估计不准确且未能充分利用 3D LiDAR 点的几何和语义信息。因此,我们提出了一种新型的多模态占据预测网络 SDG-OCC, incorporates 语义与深度引导的视角变换 coupled with 融合至占据驱动的主动蒸馏。增强的视角变换通过整合像素语义和共点深度实现精确深度分布的构建。融合至占据驱动的主动蒸馏从多模态数据中提取丰富的语义信息,并基于 LiDAR 识别区域有选择地将知识传递给图像特征。最后,为了获得最佳性能,我们引入了仅使用融合的 SDG-Fusion 以及集成融合与蒸馏以加快推理速度的 SDG-KL。我们的方法在 Occ3D-nuScenes 数据集上实现了最好的性能,在更具挑战性的 SurroundOcc-nuScenes 数据集上也表现出可比的性能,展示了其有效性和鲁棒性。代码将在 https://github.com/DzpLab/SDGOCC 发布。
引用
@article{arxiv.2507.17083,
title = {SDGOCC: Semantic and Depth-Guided Bird's-Eye View Transformation for 3D Multimodal Occupancy Prediction},
author = {Zaipeng Duan and Chenxu Dang and Xuzhong Hu and Pei An and Junfeng Ding and Jie Zhan and Yunbiao Xu and Jie Ma},
journal= {arXiv preprint arXiv:2507.17083},
year = {2025}
}
备注
accepted by CVPR2025