4D LangSplat:基于多模态大语言模型的 4D 语言高斯溅射
计算机视觉与模式识别
2025-04-02 v2
摘要
学习 4D 语言场以在动态场景中实现时间敏感的、开放的语言查询对于许多实际应用至关重要。虽然 LangSplat 成功地将 CLIP 特征嵌入到 3D 高斯表示中,在 3D 静态场景中实现了精度和效率,但缺乏处理动态 4D 场的能力,因为 CLIP 设计用于静态图像-文本任务,无法捕捉视频中的时间动态。真实环境本质上是动态的,物体语义随时间演变。构建精确的 4D 语言场需要获取像素对齐的、物体级别的视频特征,而当前视觉模型难以实现。为此,我们提出了 4D LangSplat,学习 4D 语言场以高效处理动态场景中的时间无关或时间敏感的开放词汇查询。4D LangSplat 绕过通过视觉特征学习语言场,转而直接从通过多模态大语言模型(MLLM)生成的物体级别视频标题中的文本学习。具体而言,我们提出了一种多模态物体级别视频提示方法,包含视觉提示和文本提示,用于引导 MLLM 为视频中各对象生成详细且在时间上一致的高质量标题。这些标题使用大语言模型编码为高质量句子嵌入,作为像素对齐的、面向对象的特征监督,促进通过共享嵌入空间实现开放词汇文本查询。鉴于 4D 场景中的物体在不同状态之间呈现平滑过渡,我们进一步提出了一种状态可变形网络,用于有效建模这些随时间的连续变化。我们的结果在多个基准测试上表明,4D LangSplat 能够为两种类型查询(时间敏感和时间无关)实现精确且高效的结果。
引用
@article{arxiv.2503.10437,
title = {4D LangSplat: 4D Language Gaussian Splatting via Multimodal Large Language Models},
author = {Wanhua Li and Renping Zhou and Jiawei Zhou and Yingwei Song and Johannes Herter and Minghan Qin and Gao Huang and Hanspeter Pfister},
journal= {arXiv preprint arXiv:2503.10437},
year = {2025}
}
备注
CVPR 2025. Project Page: https://4d-langsplat.github.io