中文

SLGaussian:稀疏视图下的快速语言高斯溅

计算机视觉与模式识别 2025-08-19 v3

摘要

3D语义场学习对于自动驾驶、AR/VR和机器人等应用至关重要,准确地理解来自有限视角的3D场景至为关键。现有方法在稀疏视图条件下表现不佳,依赖于每个场景的多视角优化,难以适用于许多实际任务。为此,我们提出SLGaussian,一种从稀疏视角构建3D语义场的前馈方法,允许直接推断基于3DGS的场景。通过确保通过视频跟踪的一致性SAM分段,并使用低维索引表示高维CLIP特征,SLGaussian高效地将语言信息嵌入3D空间,为稀疏视图条件下准确3D场景理解提供了稳健的解决方案。在LERF和3D-OVS数据集上的两个视图稀疏3D对象查询和分割实验中,SLGaussian在所选IoU、定位精度和mIoU方面优于现有方法。此外,我们的模型在30秒内实现场景推断,每个查询的开放词汇查询仅需0.011秒。

关键词

引用

@article{arxiv.2412.08331,
  title  = {SLGaussian: Fast Language Gaussian Splatting in Sparse Views},
  author = {Kangjie Chen and BingQuan Dai and Minghan Qin and Dongbin Zhang and Peihao Li and Yingshuang Zou and Haoqian Wang},
  journal= {arXiv preprint arXiv:2412.08331},
  year   = {2025}
}

备注

Accepted by ACM MM 2025. Project page: https://chenkangjie1123.github.io/SLGaussian.github.io/