应对 3D 语言 Gaussian Splatting 中的视角依赖语义
计算机视觉与模式识别
2025-06-02 v1
摘要
3D Gaussian Splatting (3D-GS) 的最新进展使得从 RGB 图像进行高质量 3D 场景重建成为可能。许多研究将这一范式扩展至语言驱动的开放词汇场景理解。然而,其中大多数研究仅将 2D 语义特征投影到 3D Gaussians 上,而忽略了 2D 与 3D 理解之间的一个根本差异:一个 3D 物体从不同视角可能表现出不同的语义——我们将这一现象称为视角依赖语义。为了应对这一挑战,我们提出了 LaGa (Language Gaussians),该方法通过将 3D 场景分解为物体来建立跨视角语义连接。随后,它通过对语义描述符进行聚类并基于多视角语义对其进行重加权,构建了视角聚合的语义表示。大量实验表明,LaGa 能有效从视角依赖语义中捕获关键信息,从而实现对 3D 场景更全面的理解。值得注意的是,在相同设置下,LaGa 在 LERF-OVS 数据集上较先前 SOTA 实现了 +18.7% mIoU 的显著提升。我们的代码可在以下地址获取:https://github.com/SJTU-DeepVisionLab/LaGa。
引用
@article{arxiv.2505.24746,
title = {Tackling View-Dependent Semantics in 3D Language Gaussian Splatting},
author = {Jiazhong Cen and Xudong Zhou and Jiemin Fang and Changsong Wen and Lingxi Xie and Xiaopeng Zhang and Wei Shen and Qi Tian},
journal= {arXiv preprint arXiv:2505.24746},
year = {2025}
}
备注
ICML 2025 camera ready. Project Page: https://jumpat.github.io/laga-page/