GSemSplat:从未校准的图像对通用的语义3D高斯溅写
计算机视觉与模式识别
2024-12-24 v1
摘要
建模和理解3D世界对于从增强现实到机器人导航等各种应用至关重要。最近的基于3D高斯溅写(3D Gaussian Splatting)的研究将多视角图像的语义信息整合到高斯原始数据中。然而,这些方法通常需要来自密集校准图像的场景特定优化,限制了其实际应用性。在本文中,我们考虑了从稀疏、未校准的图像对进行通用3D语义场建模的新任务。基于Splat3R架构,我们引入GSemSplat—a一个在无需场景特定优化、密集图像集合或校准的情况下学习与3D高斯关联的开放词汇语义表示的框架。为确保在3D空间中有效可靠地学习语义特征,我们采用双特征方法,该方法利用区域特定语义特征和上下文感知语义特征作为2D空间中的监督。这使我们能够利用它们的互补优势。在ScanNet++数据集上的实验结果表明,我们的方法相对于传统场景特定方法表现出色。我们希望我们的工作将激发更多关于通用3D理解的研究。
引用
@article{arxiv.2412.16932,
title = {GSemSplat: Generalizable Semantic 3D Gaussian Splatting from Uncalibrated Image Pairs},
author = {Xingrui Wang and Cuiling Lan and Hanxin Zhu and Zhibo Chen and Yan Lu},
journal= {arXiv preprint arXiv:2412.16932},
year = {2024}
}