中文

Ilov3Splat:基于高斯泼溅的实例级开放词汇3D场景理解

计算机视觉与模式识别 2026-05-14 v2 人工智能

摘要

我们引入了Ilov3Splat,一个构建于3D高斯泼溅(3D-GS)之上的实例级开放词汇3D场景理解新框架。先前的大多数工作依赖于基于2D渲染的匹配或点级语义关联,这削弱了跨视图一致性,缺乏连贯的实例级推理,并限制了下游3D任务的精度。为解决这些局限性,我们的方法通过用视图一致的特征场增强高斯泼溅,联合优化场景几何与语义表征。具体而言,我们利用多分辨率哈希嵌入高效编码语言对齐的CLIP特征,在3D空间中实现密集且连贯的语言基础。我们进一步在SAM掩码上使用对比损失训练实例特征场,支持跨视图的细粒度物体区分。在推理阶段,CLIP编码的查询与学习到的特征进行匹配,随后通过两阶段3D聚类检索相关的高斯组。这使我们的框架能够基于自然语言描述识别3D场景中的任意物体,而无需类别监督或人工标注。在标准基准上的实验表明,Ilov3Splat在物体选择和实例分割方面均优于先前的开放词汇3D-GS方法,为语言驱动的3D场景理解提供了灵活且准确的解决方案。项目页面:https://csiro-robotics.github.io/Ilov3Splat。

关键词

引用

@article{arxiv.2605.04506,
  title  = {Ilov3Splat: Instance-Level Open-Vocabulary 3D Scene Understanding in Gaussian Splatting},
  author = {Binh Long Nguyen and Kien Nguyen and Sridha Sridharan and Clinton Fookes and Peyman Moghadam},
  journal= {arXiv preprint arXiv:2605.04506},
  year   = {2026}
}

备注

The International Conference on Pattern Recognition (ICPR) 2026