在线Feed-Forward语义3DGS用于开放词汇3D场景理解:EmbodiedSplat
计算机视觉与模式识别
2026-03-05 v1
摘要
即时理解其探索过程中的3D场景是具身任务的关键所在,其中智能体必须在线且近乎实时地构建和理解3D场景。本研究提出了EmbodiedSplat,这是一种用于开放词汇场景理解的在线feed-forward 3DGS,使其能够从流式图像中实现同步的在线3D重建和3D语义理解。不同于现有的开放词汇3DGS方法通常受限于离线或单场景优化设置,本方法的目标有两个:1)从300多张流式图像中以在线方式重建整个场景的语义嵌入3DGS。2)高度可泛化至新场景,采用feed-forward设计,支持与实时2D模型结合时实现近乎实时的3D语义重建。为实现上述目标,我们提出了一种包含CLIP全局码本的在线稀疏系数场,其中将2D CLIP嵌入绑定到每个3D高斯体,同时最小化内存消耗并保持CLIP的完整语义可泛化性。此外,我们通过聚合3DGS的部分点云经3D U-Net生成3D几何感知CLIP特征,以补偿2D导向语言嵌入的3D几何先验。我们在包括ScanNet、ScanNet++和Replica在内的多种室内数据集上进行了广泛实验,证明了本方法的有效性和效率。详见我们的项目页面 https://0nandon.github.io/EmbodiedSplat/。
引用
@article{arxiv.2603.04254,
title = {EmbodiedSplat: Online Feed-Forward Semantic 3DGS for Open-Vocabulary 3D Scene Understanding},
author = {Seungjun Lee and Zihan Wang and Yunsong Wang and Gim Hee Lee},
journal= {arXiv preprint arXiv:2603.04254},
year = {2026}
}
备注
CVPR 2026, Project Page: https://0nandon.github.io/EmbodiedSplat/