中文

WeatherOcc3D:视觉语言模型辅助的恶劣天气感知三维语义占用预测

计算机视觉与模式识别 2026-05-18 v1

摘要

虽然多模态三维语义占用预测通常通过融合相机和激光雷达输入来增强鲁棒性,但其有效性从根本上受到环境变化的制约。具体来说,相机传感器在低光照下会严重退化,而激光雷达传感器在强降水期间会遇到显著的后向散射噪声。这些恶劣条件造成了模态信任问题,因为当特定传感器变得不可靠时,静态融合策略无法自适应地重新加权输入。为了解决这个问题,我们提出了一个视觉语言模型辅助框架,利用预训练的CLIP潜在空间,通过语言环境线索来指导多传感器集成。我们使用一个参数高效的适配器将天气特定的文本嵌入与传感器特征对齐,并结合一个门控策略,将环境不确定性分解为两个因素:能见度和光照。这使得模型能够动态调整融合比率——在晴朗的白天优先考虑语义相机特征,而在雨夜则转向几何激光雷达先验。在nuScenes数据集上的评估证明了我们方法的通用性,因为在OccMamba和M-CONet架构上实施我们提出的框架分别达到了26.3和21.1的mIoU分数,显著优于它们的传统基线。

关键词

引用

@article{arxiv.2605.16127,
  title  = {WeatherOcc3D: VLM-Assisted Adverse Weather Aware 3D Semantic Occupancy Prediction},
  author = {A. Enes Doruk and Abdelaziz Hussein and Hasan F. Ates},
  journal= {arXiv preprint arXiv:2605.16127},
  year   = {2026}
}