中文

基于 Gaussians 的无监督聚类以实现视图一致的 3D 场景理解

计算机视觉与模式识别 2025-05-20 v2 机器学习

摘要

将语义注入 3D 高斯溶解(3DGS)最近受到广泛关注。虽然当前方法通常从 2D 基础模型(如 CLIP 和 SAM)蒸馏 3D 语义特征以促进新视图分割和语义理解,但其对 2D 监督的强烈依赖削弱了跨视图语义一致性,并需复杂的数据准备流程,从而阻碍视图一致的场景理解。本文提出 FreeGS,一种无需 2D 标签的无监督语义嵌入式 3DGS 框架,实现视图一致的 3D 场景理解。不直接学习语义特征,而是将 IDentity-coupled Semantic Field(IDSF)引入 3DGS,为每个高斯捕获语义表征和视图一致的实例索引。采用两阶段交替策略优化 IDSF:语义帮助从 3D 空间中提取连贯实例,而所得实例正则化从 2D 空间注入稳定语义。此外,采用 2D-3D 联合对比损失以增强视图一致 3D 几何与丰富语义之间的互补性,使 FreeGS 能统一完成如新视图语义分割、对象选择和 3D 对象检测等任务。在 LERF-Mask、3D-OVS 和 ScanNet 数据集上进行大量实验表明,FreeGS 在性能上与最先进的方法相当,同时避免了复杂的数据预处理工作。我们的代码已公开于 https://github.com/wb014/FreeGS。

关键词

引用

@article{arxiv.2411.19551,
  title  = {Bootstraping Clustering of Gaussians for View-consistent 3D Scene Understanding},
  author = {Wenbo Zhang and Lu Zhang and Ping Hu and Liqian Ma and Yunzhi Zhuge and Huchuan Lu},
  journal= {arXiv preprint arXiv:2411.19551},
  year   = {2025}
}

备注

Accepted to AAAI25