中文

SPNeRF:基于超点的开词表3D神经场景分割

计算机视觉与模式识别 2025-03-21 v1

摘要

开词表分割由大型视觉语言模型如CLIP 驱动,已将2D分割能力从数据集预定义的固定类别扩展到多样场景,实现零样本理解。将这些能力扩展到3D分割带来了挑战,因为CLIP的基于图像的嵌入往往缺乏足够的几何细节以实现3D场景分割。最近的方法倾向于引入额外的分割模型或用在分割数据上训练的变体取代CLIP,这导致冗余或损失CLIP的通用语言能力。为克服这一限制,我们引入了SPNeRF,一种基于NeRF的零样本3D分割方法,利用几何先验。我们将从3D场景中推导的几何原语集成到NeRF训练中,以产生基于原语的CLIP特征,避免点特征的歧义性。此外,我们提出了增强于亲和力分数的原语级合并机制。无需依赖额外的分割模型,我们的方法进一步探索了CLIP在3D分割中的能力,并显著优于原始LERF。

关键词

引用

@article{arxiv.2503.15712,
  title  = {SPNeRF: Open Vocabulary 3D Neural Scene Segmentation with Superpoints},
  author = {Weiwen Hu and Niccolò Parodi and Marcus Zepp and Ingo Feldmann and Oliver Schreer and Peter Eisert},
  journal= {arXiv preprint arXiv:2503.15712},
  year   = {2025}
}

备注

In Proceedings of the 20th International Joint Conference on Computer Vision, Imaging and Computer Graphics Theory and Applications (2025)