中文

PanoGS:基于高斯的 3D 全景分割用于开放词汇场景理解

计算机视觉与模式识别 2025-03-25 v1

摘要

最近的 3D 高斯 splatting (3DGS) 在开放词汇场景理解任务中展现出鼓舞人心的性能。然而,先前的方法无法区分 3D 实例级信息,通常会在场景特征与文本查询之间预测热力图。在本文中,我们提出了 PanoGS,一种新颖且有效的 3D 全景开放词汇场景理解方法。技术上,为学习能适用于大型室内场景的准确 3D 语言特征,我们采用金字塔三平面模型来表示潜在的连续参数特征空间,并使用 3D 特征解码器对多视角融合的 2D 特征云进行回归。此外,我们提出了语言引导的图割技术,协同利用重建的几何信息和学习到的语言线索,将 3D 高斯原始片段分组为一组超原始片段。为获得 3D 一致的实例,我们基于 SAM 指导的边缘亲和力计算进行图聚类分割。大量实验表明,PanoGS 在 3D 全景开放词汇场景理解方面表现更好或更具竞争力。项目页面:\href{https://zju3dv.github.io/panogs}{https://zju3dv.github.io/panogs}。

关键词

引用

@article{arxiv.2503.18107,
  title  = {PanoGS: Gaussian-based Panoptic Segmentation for 3D Open Vocabulary Scene Understanding},
  author = {Hongjia Zhai and Hai Li and Zhenzhe Li and Xiaokun Pan and Yijia He and Guofeng Zhang},
  journal= {arXiv preprint arXiv:2503.18107},
  year   = {2025}
}

备注

CVPR 2025