中文

CAGS:基于上下文感知高斯溅写的开放词汇 3D 场景理解

计算机视觉与模式识别 2025-04-17 v1

摘要

开放词汇 3D 场景理解对于需要自然语言驱动的空间解释的应用至关重要,如机器人和增强现实领域。虽然 3D 高斯溅写(3DGS)为场景重建提供了强大的表示方法,但将其与开放词汇框架集成后,存在关键挑战:跨视角粒度不一致问题。这一问题源于诸如 SAM 等 2D 分割方法,导致不同视角下物体分段不一致(例如,一个“咖啡套装”在一个视角中被分割为单一实体,但在另一个视角中被分割为“杯子 + 咖啡 + 勺子”)。现有基于 3DGS 的方法通常依赖孤立的每高斯特征学习,忽视了用于协同物体推理的空间上下文,导致表征碎片化。我们提出了一种名为 CAGS(Context-Aware Gaussian Splatting)的新型框架,通过在 3DGS 中引入空间上下文来解决上述挑战。CAGS 构建局部图来传播跨高斯的上下文特征,减少因粒度不一致导致的噪声;采用基于掩码的对比学习平滑 SAM 派生的特征跨视角;并利用预计算策略来减少大规模场景中的计算成本,实现高效训练。通过整合空间上下文,CAGS 在 LERF-OVS 和 ScanNet 等数据集上显著提升 3D 实例分割效果,减少碎片化错误,实现面向语言的 3D 场景理解。

关键词

引用

@article{arxiv.2504.11893,
  title  = {CAGS: Open-Vocabulary 3D Scene Understanding with Context-Aware Gaussian Splatting},
  author = {Wei Sun and Yanzhao Zhou and Jianbin Jiao and Yuan Li},
  journal= {arXiv preprint arXiv:2504.11893},
  year   = {2025}
}