OVGaussian:基于开放词汇的通用3D高斯分割
计算机视觉与模式识别
2025-01-03 v1 机器学习
摘要
使用3D高斯(3DGS)表示进行开放词汇场景理解引发了广泛关注。然而,现有方法大多在场景级别上将大型2D视觉模型的知识提升到3DGS上,限制了其在训练场景内进行开放词汇查询的能力,从而缺乏对新场景的通用性。在本工作中,我们提出了\textbf{OVGaussian},一个基于3D \textbf{Gaussian}表示的通用\textbf{O}pen-\textbf{V}ocabulary 3D语义分割框架。我们首先构建了一个基于3DGS的大规模3D场景数据集,称为\textbf{SegGaussian},为高斯点和多视图图像提供详细的语义和实例标注。为促进跨场景的语义泛化,我们引入了通用语义光栅化(GSR),该方法利用3D神经网络学习和预测每个3D高斯点的语义属性,其中语义属性可渲染为多视图一致的2D语义图。在随后,我们提出了跨模态一致性学习(CCL)框架,该框架利用SegGaussian中2D图像和3D高斯的开放词汇标注,在训练能够进行开放词汇语义分割的3D神经网络。实验结果表明,OVGaussian显著优于基线方法,展现出强大的跨场景、跨域和新视角泛化能力。代码和SegGaussian数据集将发布。(https://github.com/runnanchen/OVGaussian)
引用
@article{arxiv.2501.00326,
title = {OVGaussian: Generalizable 3D Gaussian Segmentation with Open Vocabularies},
author = {Runnan Chen and Xiangyu Sun and Zhaoqing Wang and Youquan Liu and Jiepeng Wang and Lingdong Kong and Jiankang Deng and Mingming Gong and Liang Pan and Wenping Wang and Tongliang Liu},
journal= {arXiv preprint arXiv:2501.00326},
year = {2025}
}