将视觉几何先验推广到稀疏高斯占据预测
计算机视觉与模式识别
2026-02-26 v1
摘要
准确的 3D 场景理解是具身智能的关键任务,占据预测作为推理对象和自由空间的关键任务。现有方法主要依赖深度先验(如 DepthAnything),但仅有限地利用 3D 线索,限制了性能和泛化能力。最近,视觉几何模型如 VGGT 在提供丰富 3D 先验方面表现突出,但与单目深度基础模型类似,它们仍 operate于可见表面层面而非体素内部,促使我们探索如何更有效地利用这些日益强大的几何先验进行 3D 占据预测。我们提出 GPOcc 框架,利用通用视觉几何先验 (GPs) 进行单目占据预测。该方法将表面点沿相机光线向内扩展以生成体素样本,样本表示为高斯原始构件,以实现概率占据推断。为处理流式输入,我们进一步设计了无训练的增量更新策略,将每帧高斯融合到统一的全局表示中。在 Occ-ScanNet 和 EmbodiedOcc-ScanNet 上的实验显示,GPOcc 在单目设置下以 +9.99 的 mIoU 提升,在流式设置下以 +11.79 的 mIoU 提升。相当于在相同深度先验下,它实现了 +6.73 mIoU 的提升,同时运行速度快 2.65 倍。这些结果表明 GPOcc 更高效、更有效地利用了几何先验。代码将在 https://github.com/JuIvyy/GPOcc 发布。
引用
@article{arxiv.2602.21552,
title = {Generalizing Visual Geometry Priors to Sparse Gaussian Occupancy Prediction},
author = {Changqing Zhou and Yueru Luo and Changhao Chen},
journal= {arXiv preprint arXiv:2602.21552},
year = {2026}
}
备注
Accepted by CVPR2026