中文

econSG:面向开放词汇表的高效多视角一致的 3D 语义高斯

计算机视觉与模式识别 2025-04-09 v1

摘要

最近大量关于开放词汇表神经场的工作,主要聚焦于从视觉语言模型(VLM)中提取精确的语义特征,然后高效地将其整合到多视角一致的 3D 神经场表示中。然而,大多数现有工作过度依赖 SAM 来正则化图像级 CLIP,却未进行进一步的细化。此外,一些工作通过对 2D VLM 的语义特征进行维度压缩,再与 3DGS 语义场融合,以提升效率,却不可避免地导致多视角不一致。在本文中,我们提出了用于 3DGS 的开放词汇表语义分割的 econSG 方法。我们的 econSG 包括:1) 基于置信区域的正则化(CRR),相互细化 SAM 与 CLIP 以获取两者优势,实现语义特征的精确边界;2) 低维情境空间以强制 3D 多视角一致性,同时通过融合回投影的多视角 2D 特征后直接在融合后的 3D 特征上进行维度压缩,而非分别对每个 2D 视图进行操作,从而提升计算效率。我们在四个基准数据集上进行实验,证明 econSG 在性能和效率上均实现了最先进的水平。

关键词

引用

@article{arxiv.2504.06003,
  title  = {econSG: Efficient and Multi-view Consistent Open-Vocabulary 3D Semantic Gaussians},
  author = {Can Zhang and Gim Hee Lee},
  journal= {arXiv preprint arXiv:2504.06003},
  year   = {2025}
}