SemanticSplat:基于语言感知高斯场的前馈式三维场景理解
计算机视觉与模式识别
2025-06-16 v2
摘要
整体三维场景理解,即联合建模几何、外观和语义,对于增强现实和机器人交互等应用至关重要。现有前馈式三维场景理解方法(如LSM)仅限于从场景中提取语言驱动的语义,未能实现整体场景理解。此外,它们还存在几何重建质量低和噪声伪影的问题。相比之下,逐场景优化方法依赖密集输入视图,降低了实用性并增加了部署复杂性。在本文中,我们提出SemanticSplat——一种前馈式语义感知的三维重建方法,将三维高斯与潜在语义属性相统一,实现联合几何-外观-语义建模。为预测语义各向异性高斯,SemanticSplat融合多种特征场(如LSeg、SAM)与存储跨视图特征相似度的代价体积表示,增强了连贯且准确的场景理解。利用两阶段蒸馏框架,SemanticSplat从稀疏视图图像中重建整体多模态语义特征场。实验证明了我们方法在三维场景理解任务(如可提示分割和开放词汇分割)中的有效性。视频结果可在 https://semanticsplat.github.io 获取。
引用
@article{arxiv.2506.09565,
title = {SemanticSplat: Feed-Forward 3D Scene Understanding with Language-Aware Gaussian Fields},
author = {Qijing Li and Jingxiang Sun and Liang An and Zhaoqi Su and Hongwen Zhang and Yebin Liu},
journal= {arXiv preprint arXiv:2506.09565},
year = {2025}
}