ShelfGaussian: 基于现成监督的开放词汇高斯3D场景理解
计算机视觉与模式识别
2026-04-13 v3
摘要
我们提出了ShelfGaussian,一个由现成视觉基础模型(VFMs)监督的开放词汇多模态基于高斯的3D场景理解框架。基于高斯的方法在广泛的场景理解任务中已展现出优越的性能和计算效率。然而,现有方法要么将物体建模为受标注3D标签监督的封闭集合语义高斯,忽略其渲染能力;要么通过纯2D自监督学习开放集合高斯表示,导致几何退化且仅限于相机设置。为了充分利用高斯的潜力,我们提出了一种多模态高斯Transformer,使高斯能够从多种传感器模态中查询特征,以及一种现成监督学习范式,能够在2D图像和3D场景层面联合利用VFM特征高效优化高斯。我们在多种感知与规划任务上评估了ShelfGaussian。在Occ3D-nuScenes上的实验验证了其最先进的零样本语义占用预测性能。ShelfGaussian进一步在无人地面车辆(UGV)上进行了评估,以考察其在多样化城市场景中的野外性能。项目网站:https://lunarlab-gatech.github.io/ShelfGaussian/.
引用
@article{arxiv.2512.03370,
title = {ShelfGaussian: Shelf-Supervised Open-Vocabulary Gaussian-based 3D Scene Understanding},
author = {Lingjun Zhao and Yandong Luo and James Hays and Lu Gan},
journal= {arXiv preprint arXiv:2512.03370},
year = {2026}
}