通用语言高斯溅射:基于预训练特征压缩的通用语言模型
计算机视觉与模式识别
2025-10-28 v1 人工智能
摘要
建模3D中的开放词汇语言场对于直观的人机交互和查询物理环境至关重要。当前的方法(如LangSplat)利用3D高斯溅射(3D Gaussian Splatting)高效构建这些语言场,将来自CLIP等高维模型提炼的特征编码。然而,这种效率目前仍被一种场景特定语言自编码器的训练要求所消耗,引入了每个场景优化瓶颈,阻碍了部署规模性。本文引入Gen-LangSplat,通过用在大规模ScanNet数据集上预训练的通用自编码器取代场景级自编码器,这一架构变化使得可以在任何新场景中使用固定、紧凑的潜在空间处理语言特征,而无需场景特定训练。通过消除这一依赖,整个语言场构建过程在效率上实现了提升,同时在查询性能方面表现出与原始LangSplat相当或更好的效果。为验证我们的设计选择,我们进行了彻底的消融研究,经验性地确定最佳潜在嵌入维度,并使用均方误差(Mean Squared Error)和余弦相似性(cosine similarity)量化原始512维CLIP嵌入与重投影嵌入之间的表示保真度。我们的结果表明,通用嵌入能够高效且准确地支持新建场景中开放词汇查询,为可扩展的实时交互式3D AI应用铺平了道路。
引用
@article{arxiv.2510.22930,
title = {Gen-LangSplat: Generalized Language Gaussian Splatting with Pre-Trained Feature Compression},
author = {Pranav Saxena},
journal= {arXiv preprint arXiv:2510.22930},
year = {2025}
}