LangScene-X: 使用TriMap视频扩散重建可泛化的3D语言嵌入场景
计算机视觉与模式识别
2025-07-04 v1
摘要
从二维图像恢复具有开放词汇场景理解的三维结构是一项基本但艰巨的任务。最近的发展通过使用嵌入的语言信息进行逐场景优化实现了这一点。然而,它们严重依赖于校准的密集视图重建范式,因此在可用视图有限时会出现严重的渲染伪影和不可信的语义合成。在本文中,我们引入了一个新颖的生成框架,称为LangScene-X,以统一并生成用于重建和理解的3D一致多模态信息。借助生成更一致的新颖观测的能力,我们可以仅从稀疏视图构建可泛化的3D语言嵌入场景。具体来说,我们首先训练一个TriMap视频扩散模型,该模型可以通过渐进知识整合从稀疏输入生成外观(RGB)、几何(法线)和语义(分割图)。此外,我们提出了一种语言量化压缩器(LQC),在大规模图像数据集上进行训练,以高效编码语言嵌入,实现跨场景泛化而无需逐场景重新训练。最后,我们通过将语言信息对齐到3D场景表面上来重建语言表面场,从而实现开放式的语言查询。在真实世界数据上的大量实验证明了我们的LangScene-X在质量和泛化性方面优于最先进的方法。项目页面:https://liuff19.github.io/LangScene-X。
引用
@article{arxiv.2507.02813,
title = {LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion},
author = {Fangfu Liu and Hao Li and Jiawei Chi and Hanyang Wang and Minghui Yang and Fudong Wang and Yueqi Duan},
journal= {arXiv preprint arXiv:2507.02813},
year = {2025}
}
备注
Project page: https://liuff19.github.io/LangScene-X