GaussianOcc3D:基于高斯分布的自适应多模态三维占用预测
计算机视觉与模式识别
2026-02-02 v1
摘要
3D语义占用预测是自动驾驶中的关键任务,能够提供对周围环境的稠密且细粒度的理解,但单模态方法在相机语义和激光雷达几何之间面临权衡。现有多模态框架常在模态异构性、空间错位以及表示危机——其中体素计算负担沉重,BEV方案则信息丢失——方面困难重重。我们提出GaussianOcc3D,一个通过内存高效的连续三维高斯表示桥接相机与激光雷达的多模态框架。我们引入四个模块:(1)LiDAR深度特征聚合(LDFA),采用基于深度的可变形采样将稀疏信号提升至高斯原语上;(2)熵基特征平滑(EBFS)以缓解域噪声;(3)自适应相机-激光雷达融合(ACLF),基于不确定性对传感器可靠性进行加权;(4)高斯-Mamba头部,利用选择性状态空间模型实现全局上下文且时间复杂度为线性。 在Occ3D、SurroundOcc和SemanticKITTI基准测试中进行评估,展示出领先的性能,分别达到49.4%、28.9%和25.2%的mIoU分数。GaussianOcc3D在恶劣雨天和夜间条件下展现出优异的鲁棒性。
引用
@article{arxiv.2601.22729,
title = {GaussianOcc3D: A Gaussian-Based Adaptive Multi-modal 3D Occupancy Prediction},
author = {A. Enes Doruk and Hasan F. Ates},
journal= {arXiv preprint arXiv:2601.22729},
year = {2026}
}