Gau-Occ:用于多模态三维占用预测的几何完成高斯
计算机视觉与模式识别
2026-03-25 v1
摘要
三维语义占用预测是自动驾驶中的关键任务。虽然多模态融合在视觉单模态方法上提升了精度,但通常依赖计算昂贵的稠密体素或 BEV 张量。我们提出 Gau-Occ,一个绕过稠密体素处理的多模态框架,通过将场景建模为紧凑的语义三维高斯集合来实现。为确保几何完整性,我们提出了激光雷达完成扩散器 (LiDAR Completion Diffuser, LCD),用于从稀疏激光雷达恢复缺失结构以初始化稳健的高斯锚定点。此外,我们引入了高斯锚定点融合 (Gaussian Anchor Fusion, GAF),通过几何对齐的二维抽样和跨模态对齐高效整合多视角图像语义。通过细化这些紧凑的高斯描述符,Gau-Occ 能够捕获空间一致性和语义判别性。广泛的实验在具有挑战性基准上表明,Gau-Occ 在计算效率和性能方面均实现了最先进的水平。
引用
@article{arxiv.2603.22852,
title = {Gau-Occ: Geometry-Completed Gaussians for Multi-Modal 3D Occupancy Prediction},
author = {Chengxin Lv and Yihui Li and Hongyu Yang and YunHong Wang},
journal= {arXiv preprint arXiv:2603.22852},
year = {2026}
}