中文

面向 3D 高斯溅写的可见性感知语言聚合用于开放词汇分割

计算机视觉与模式识别 2026-02-12 v2

摘要

最近, distilling open-vocabulary language features from 2D images into 3D Gaussians 受到广泛关注。尽管现有方法在 3D 场景中实现了令人瞩目的语言交互,但我们注意到两个根本问题:背景高斯体因渲染像素贡献微乎其微,却获得与占主导地位的前景高斯体相同的特征;以及由于视图特定噪声在语言嵌入中导致的多视图不一致。我们引入 Visibility-Aware Language Aggregation (VALA),一种轻量且有效的方法为每条光线计算边际贡献,并应用可见性感知门控仅保留可见高斯体。此外,我们提出一种在余弦空间中进行的流式加权几何中位数,以整合噪声多视图特征。我们的方法在快速且内存高效的情况下生成稳健、一致的语言特征嵌入。VALA 在参考数据集上提升了开放词汇定位和分割,持续超过现有工作。更多结果可在 https://vala3d.github.io 查看。

关键词

引用

@article{arxiv.2509.05515,
  title  = {Visibility-Aware Language Aggregation for Open-Vocabulary Segmentation in 3D Gaussian Splatting},
  author = {Sen Wang and Kunyi Li and Siyun Liang and Elena Alegret and Jing Ma and Nassir Navab and Stefano Gasperini},
  journal= {arXiv preprint arXiv:2509.05515},
  year   = {2026}
}

备注

Project page: https://vala3d.github.io