Lang3D-XL:大规模场景的语言嵌入式3D高斯
计算机视觉与模式识别
2025-12-09 v1 图形学
摘要
在3D表示中嵌入语言场可通过将几何与描述性意义关联,实现对空间环境更丰富的语义理解。这使得利用自然语言查询或编辑场景成为更直观的人机交互方式,可能有助于提升场景检索、导航和多模态推理等任务。尽管这些能力在特定于大规模场景方面具有变革潜力,但我们发现近期的特征提取方法无法有效地在大规模互联网数据上学习,因语义特征错位和内存运行效率等方面的挑战。为此,我们提出了一种新方法以应对这些挑战。首先,我们引入极低维语义瓶颈特征作为底层3D高斯表示的一部分。这些特征经由渲染通过多分辨率、基于特征的散列编码处理。显著提高了运行时和GPU内存的效率。其次,我们引入衰减下采样模块,并提出了若干正则化措施以解决2D特征真值之间的语义错位问题。在野生HolyScenes数据集上进行评估,我们的方法在性能和效率方面均优于现有方法。
引用
@article{arxiv.2512.07807,
title = {Lang3D-XL: Language Embedded 3D Gaussians for Large-scale Scenes},
author = {Shai Krakovsky and Gal Fiebelman and Sagie Benaim and Hadar Averbuch-Elor},
journal= {arXiv preprint arXiv:2512.07807},
year = {2025}
}
备注
Accepted to SIGGRAPH Asia 2025. Project webpage: https://tau-vailab.github.io/Lang3D-XL