CLIP-GS:基于CLIP的高斯溅写用于视图一致的3D室内语义理解
计算机视觉与模式识别
2025-06-24 v2
摘要
利用对比语言-图像预训练(CLIP)模型与3D高斯溅写(3DGS)进行室内场景开放词汇3D语义理解已成为引人关注的研究焦点。现有方法通常将高维CLIP语义嵌入附加到3D高斯上,并利用视图不一致的2D CLIP语义作为高斯监督,导致效率瓶颈和不足的3D语义一致性。为此,我们提出CLIP-GS,通过提出的语义属性紧凑性(Semantic Attribute Compactness, SAC)和3D一致性正则化(3D Coherent Regularization, 3DCR)高效实现室内3D场景的连贯语义理解。SAC方法利用物体中天然统一的语义来学习紧凑而有效的语义高斯表示,实现高效渲染(>100 FPS)。3DCR在2D和3D域之间强制语义一致性:在2D中,3DCR利用来自3DGS的优化后视图一致语义结果建立跨视图一致性约束;在3D中,3DCR鼓励与同一物体相关的3D高斯原始变量之间的特征相似性,从而实现更精确和连贯的分割结果。大量实验结果表明,我们的方法显著抑制了现有的SOTA方法,在ScanNet和Replica数据集上分别实现了21.20%和13.05%的mIoU提升,同时保持实时渲染速度。此外,我们的方法即使在稀疏输入数据下也表现出色,证明了其鲁棒性。
引用
@article{arxiv.2404.14249,
title = {CLIP-GS: CLIP-Informed Gaussian Splatting for View-Consistent 3D Indoor Semantic Understanding},
author = {Guibiao Liao and Jiankun Li and Zhenyu Bao and Xiaoqing Ye and Qing Li and Kanglin Liu},
journal= {arXiv preprint arXiv:2404.14249},
year = {2025}
}
备注
ACM TOMM 2025