VLMFusionOcc3D:基于视觉语言模型的多模态 3D 语义占据预测
计算机视觉与模式识别
2026-03-04 v1 机器人学
摘要
本文提出 VLMFusionOcc3D,一个用于自动驾驶中稠密 3D 语义占据预测的鲁棒多模态框架。当前的体素化占据模型常在稀疏几何网格中面临语义歧义问题,以及在恶劣天气条件下性能下降。为此,我们利用视觉语言模型 (VLM) 所蕴含的丰富语言先验,将模糊的体素特征锚定到稳定的语义概念上。我们的框架以双分支特征提取管道开始,将多视角图像和激光点云投影到统一的体素空间。我们提出了基于实例的 VLM 注意力机制 (InstVLM),利用门控交叉注意力和 LoRA 适配的 CLIP 嵌入,将高层语义和地理先验直接注入 3D 体素中。此外,我们引入天气感知自适应融合 (WeathFusion),一种动态门控机制,利用车辆元数据和天气条件提示,根据实时环境可靠性重新加权传感器贡献。为确保结构一致性,采用基于深度的几何对齐 (DAGA) 损失,将稠密相机几何与稀疏且几何精确的激光点匹配。广泛的在 nuScenes 和 SemanticKITTI 数据集上的实验表明,我们的插拔式模块持续增强了最先进的基于体素的基线模型的性能。值得注意的是,在恶劣天气情形下,我们的方法实现了显著的性能提升,为复杂城市导航提供了可扩展且稳健的解决方案。
引用
@article{arxiv.2603.02609,
title = {VLMFusionOcc3D: VLM Assisted Multi-Modal 3D Semantic Occupancy Prediction},
author = {A. Enes Doruk and Hasan F. Ates},
journal= {arXiv preprint arXiv:2603.02609},
year = {2026}
}