语义高斯:基于3D高斯泼溅的开放词汇场景理解
计算机视觉与模式识别
2024-08-26 v2
摘要
开放词汇的3D场景理解是计算机视觉中的一个重大挑战,在具身智能体和增强现实系统中有着广泛应用。现有方法采用神经渲染方法作为3D表示,并联合优化颜色和语义特征,以同时实现渲染和场景理解。在本文中,我们介绍了语义高斯(Semantic Gaussians),这是一种基于3D高斯泼溅(3D Gaussian Splatting)的新型开放词汇场景理解方法。我们的核心思想是将知识从2D预训练模型蒸馏到3D高斯中。与现有方法不同,我们设计了一种通用的投影方法,将来自预训练图像编码器的各种2D语义特征映射到3D高斯的一个新颖语义组件中,该方法基于空间关系且无需额外训练。我们进一步构建了一个3D语义网络,该网络直接从原始3D高斯预测语义组件,以实现快速推理。在ScanNet分割和LERF物体定位上的定量结果证明了我们方法的优越性能。此外,我们探索了语义高斯的多种应用,包括物体部件分割、实例分割、场景编辑和时空分割,与2D和3D基线相比,均取得了更好的定性结果,突显了其在支持多样化下游任务方面的通用性和有效性。
引用
@article{arxiv.2403.15624,
title = {Semantic Gaussians: Open-Vocabulary Scene Understanding with 3D Gaussian Splatting},
author = {Jun Guo and Xiaojian Ma and Yue Fan and Huaping Liu and Qing Li},
journal= {arXiv preprint arXiv:2403.15624},
year = {2024}
}
备注
Project page: see https://semantic-gaussians.github.io