中文

Dr.Occ:基于深度与区域引导的无感知摄像头 3D 占据预测框架用于自动驾驶

计算机视觉与模式识别 2026-03-06 v3

摘要

3D 语义占据预测是自动驾驶感知的关键技术,能够提供全面的几何场景理解和语义识别。然而,现有方法由于缺乏像素级精确深度估计,难以处理视图转换中的几何错位问题;同时面临语义类别在空间上的严重不平衡问题。为此,我们提出 Dr. Occ,一种深度与区域引导的占据预测框架。具体而言,我们引入深度引导的 2D 到 3D 视图转换器(D2^2-VFormer),有效利用来自 MoGe-2 的高质量稠密深度线索,构建可靠的几何先验,从而实现体素特征的精确几何对齐。此外,受 Mixture-of-Experts(MoE)框架的启发,我们提出区域引导的专家转换器(R/R2^2-EFormer),自适应分配区域特定专家以关注不同空间区域,有效解决空间语义变异问题。因此,两个组件互为补充:深度引导确保几何对齐,而区域专家增强语义学习。在 Occ3D--nuScenes 基准测试中,实验表明 Dr. Occ 在仅使用视觉信息的设置下,相较于强基线 BEVDet4D 提升了 7.43% 的 mIoU 和 3.09% 的 IoU。

关键词

引用

@article{arxiv.2603.01007,
  title  = {Dr.Occ: Depth- and Region-Guided 3D Occupancy from Surround-View Cameras for Autonomous Driving},
  author = {Xubo Zhu and Haoyang Zhang and Fei He and Rui Wu and Yanhu Shan and Wen Yang and Huai Yu},
  journal= {arXiv preprint arXiv:2603.01007},
  year   = {2026}
}

备注

10 pages, 6 figures. Accepted at CVPR 2026