UniGS:基于高斯溅写的统一语言-图像-3D 预训练
计算机视觉与模式识别
2025-02-28 v2
摘要
近期在多模态 3D 预训练方法方面的进展显示出在学习文本、图像和点云联合表示方面的前景作用。然而,采用点云作为 3D 表示会未能充分捕捉 3D 世界的细微差别,并且与图像中稠密 2D 像素之间存在明显的差距。为解决此问题,我们提出了 UniGS,将 3D 高斯溅写 (3DGS) 集成到多模态预训练中以增强 3D 表示。我们首先依赖 3DGS 表示将 3D 世界建模为一组具有颜色和不透明度的 3D 高斯,同时包含所有 3D 场景信息并与 2D 图像建立强烈联系。随后,为实现语言-图像-3D 关联,UniGS 首先使用预训练的视觉-语言模型通过大量真实世界图像-文本对建立共享的视觉和文本空间。然后,UniGS 采用 3D 编码器将优化的 3DGS 与语言-图像表示对齐,以学习统一的多模态表示。为便于 3D 编码器提取全局显式 3D 特征并实现更好的跨模态对齐,我们额外引入了一种新颖的高斯感知引导模块,该模块指导学习 3D 领域的细粒度表示。在 Objaverse、ABO、MVImgNet 和 SUN RGBD 数据集上进行的大量实验表明,UniGS 在学习更通用和更强对齐的多模态表示方面效果显著。具体而言,UniGS 在不同 3D 任务上均取得领先成绩,相较于之前的 SOTA 方法 Uni3D 实现了显著提升,包括零样本分类 (+9.36%)、文本驱动检索 (+4.3%) 和开放世界理解 (+7.92%)。
引用
@article{arxiv.2502.17860,
title = {UniGS: Unified Language-Image-3D Pretraining with Gaussian Splatting},
author = {Haoyuan Li and Yanpeng Zhou and Tao Tang and Jifei Song and Yihan Zeng and Michael Kampffmeyer and Hang Xu and Xiaodan Liang},
journal= {arXiv preprint arXiv:2502.17860},
year = {2025}
}
备注
ICLR 2025; Corrected citation of Uni3D;