MS-Occ:基于多阶段激光雷达-摄像头融合的3D语义占用预测
计算机视觉与模式识别
2025-11-17 v2
摘要
准确的3D语义占用感知是应对复杂环境中多样化和不规则物体的自动驾驶的关键。虽然以视觉为中心的方法存在几何误差,激光雷达方法则缺乏丰富的语义信息。为解决这些限制,本文提出MS-Occ,一种 novel 多阶段激光雷达-摄像头融合框架,包括中期融合和后期融合,通过层次化跨模态融合将激光雷达的几何保真度与基于相机的语义丰富性相结合。该框架在两个关键阶段引入创新:(1)在中期特征融合中,Gaussian-Geo模块利用高斯核渲染稀疏激光雷达深度图,以增强2D图像特征的稠密几何先验;Semantic-Aware模块通过可变形跨注意力丰富激光雷达体素的语义上下文;(2)在后期体素融合中,Adaptive Fusion模块动态平衡跨模态的体素特征,而High Classification Confidence Voxel Fusion模块则利用自注意力机制解决语义不一致性。在两个大规模基准测试上进行实验,证明了最先进的性能。在nuScenes-OpenOccupancy基准上,MS-Occ实现了32.1%的交并比(IoU)和25.3%的平均IoU(mIoU),超越最先进方法分别提升了0.7%的IoU和2.4%的mIoU。此外,在SemanticKITTI基准上,我们的方法实现了新的最先进mIoU的24.08%,稳健地验证了其泛化能力。消融研究进一步确认了每个单独模块的有效性,突出了在小目标感知方面的显著性改进,强化了MS-Occ在安全关键型自动驾驶场景中的实际价值。
关键词
引用
@article{arxiv.2504.15888,
title = {MS-Occ: Multi-Stage LiDAR-Camera Fusion for 3D Semantic Occupancy Prediction},
author = {Zhiqiang Wei and Lianqing Zheng and Jianan Liu and Tao Huang and Qing-Long Han and Wenwen Zhang and Fengdeng Zhang},
journal= {arXiv preprint arXiv:2504.15888},
year = {2025}
}
备注
8 pages, 5 figures