CLIP-GS:基于 3D 高斯溅写统一视觉语言表示
计算机视觉与模式识别
2026-01-13 v2
摘要
近期的 3D 多模态学习取得了显著进展。然而,通常 3D 多模态模型仅能处理点云数据。相较于新兴的 3D 表示技术 3D 高斯溅写 (3D Gaussian Splatting, 3DGS),稀疏的点云无法描绘 3D 物体的纹理信息,导致复原能力有限。这一局限限制了点云基础 3D 多模态表示学习的潜力。本文提出 CLIP-GS,一个基于 3DGS 的新型多模态表示学习框架。我们引入 GS Tokenizer 生成序列化的高斯 token,通过预先初始化自点云模型权重的 transformer 层处理,得到 3DGS 嵌入。CLIP-GS 利用 3DGS 与 CLIP 视觉文本嵌入之间的对比损失,并引入图像投�票损失引导梯度优化的方向性和收敛性。此外,我们开发了高效的 3DGS、图像和文本三元组生成方法,促进 CLIP-GS 学习统一的多模态表示。凭借对齐良好的多模态表示,CLIP-GS 在各种 3D 任务上表现出色,包括多模态检索、零样本和少样本分类,优于点云基础模型。
引用
@article{arxiv.2412.19142,
title = {CLIP-GS: Unifying Vision-Language Representation with 3D Gaussian Splatting},
author = {Siyu Jiao and Haoye Dong and Yuyang Yin and Zequn Jie and Yinlong Qian and Yao Zhao and Humphrey Shi and Yunchao Wei},
journal= {arXiv preprint arXiv:2412.19142},
year = {2026}
}