中文

LESV:用于开放词汇 3D 场景理解的语言嵌入稀疏体素融合

计算机视觉与模式识别 2026-04-03 v1

摘要

开放词汇 3D 场景理解的最新进展严重依赖 3D 高斯溅写(3DGS)将视觉语言特征注册到 3D 空间中。然而,我们识别出这些方法存在两个关键局限性:由不可结构化、重叠的高斯导致的空间歧义,这使得特征注册需要概率方法;以及由对对象级掩码进行池化导致的多层语义歧义,这会稀释细粒度细节。为解决这些挑战,我们提出了一种新框架,利用稀疏体素光栅化(SVRaster)作为结构化、不相交的几何表示。通过对 SVRaster 应用单目深度和法线先验,我们建立了稳定的几何基础。这使得特征注册过程变为确定性且具有置信度 awareness,抑制了 3DGS 中常见的语义漂移artifact。此外,我们利用基础模型 AM-RADIO 的新兴密集对齐特性来解决多层歧义,避免了层次化训练方法的计算开销。我们的方法在开放词汇 3D 对象检索和点云理解基准测试中实现了最先进的性能,尤其在注册方法通常难以应对的细粒度查询方面表现突出。

关键词

引用

@article{arxiv.2604.01388,
  title  = {LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding},
  author = {Fusang Wang and Nathan Piasco and Moussab Bennehar and Luis Roldão and Dzmitry Tsishkou and Fabien Moutarde},
  journal= {arXiv preprint arXiv:2604.01388},
  year   = {2026}
}