中文

从视频学习以理解3D世界:利用3D视觉几何先验增强MLLM

计算机视觉与模式识别 2025-10-23 v3 人工智能

摘要

先前的研究通过将3D场景解释为视频,探索了多模态大语言模型(MLLM)在理解3D场景中的应用。这些方法通常依赖于全面的3D数据输入,如点云或重建的鸟瞰图(BEV)地图。在我们的研究中,我们通过增强MLLM直接从视频数据中理解和推理3D空间的能力,而无需额外的3D输入,从而推进了该领域。我们提出了一种新颖且高效的方法,称为Video-3D Geometry Large Language Model(VG LLM)。我们的方法利用3D视觉几何编码器从视频序列中提取3D先验信息。然后将该信息与视觉标记整合并输入到MLLM中。大量实验表明,我们的方法在直接从视频源学习的3D场景理解和空间推理相关任务上取得了显著改进。令人印象深刻的是,我们的4B模型不依赖显式3D数据输入,与现有最先进方法相比取得了有竞争力的结果,甚至在VSI-Bench评估中超越了Gemini-1.5-Pro。

关键词

引用

@article{arxiv.2505.24625,
  title  = {Learning from Videos for 3D World: Enhancing MLLMs with 3D Vision Geometry Priors},
  author = {Duo Zheng and Shijia Huang and Yanyang Li and Liwei Wang},
  journal= {arXiv preprint arXiv:2505.24625},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025