4DLangVGGT:4D语言-视觉几何 grounding Transformer
计算机视觉与模式识别
2025-12-05 v1
摘要
构建4D语言场对于具身人工智能、增强/虚拟现实以及4D场景理解至关重要,因为它们提供了动态环境的丰富语义表示,使其能够在复杂情境中实现开放词汇查询。然而,现有的4D语义场构建方法主要依赖于场景特定的高斯点云,这需要进行场景特定优化,具有有限的泛化性,且难以扩展到实际应用。为此,我们提出了4DLangVGGT,即首个基于Transformer的feed-forward统一框架,用于4D语言 grounding,该框架在单个架构中联合集成了几何感知和语言对齐。4DLangVGGT包含两个关键组件:4D视觉几何Transformer,StreamVGGT,捕获动态场景的时空几何表示;以及语义桥接解码器(SBD),将几何感知特征投射到语言对齐的语义空间,从而在保持结构忠诚度的同时增强语义可解释性。与依赖昂贵场景特定优化的先前方法不同,4DLangVGGT可以跨越多个动态场景进行联合训练,并在推理时直接应用,实现部署效率和强泛化能力。该设计显著提高了大规模部署的实用性,建立了开放词汇4D场景理解的新范式。在HyperNeRF和Neu3D数据集上的实验表明,我们的方法不仅有效地实现了泛化,而且实现了最先进的性能,在场景特定训练下提升了最高可达2%,在多场景训练下提升了1%。我们的代码已发布于 https://github.com/hustvl/4DLangVGGT
引用
@article{arxiv.2512.05060,
title = {4DLangVGGT: 4D Language-Visual Geometry Grounded Transformer},
author = {Xianfeng Wu and Yajing Bai and Minghan Li and Xianzu Wu and Xueqi Zhao and Zhongyuan Lai and Wenyu Liu and Xinggang Wang},
journal= {arXiv preprint arXiv:2512.05060},
year = {2025}
}
备注
Code: https://github.com/hustvl/4DLangVGGT, Webpage: https://hustvl.github.io/4DLangVGGT