中文

G$^2$VLM:基于统一3D重建与空间推理的几何 grounding 视觉语言模型

量子物理 2026-05-11 v2 统计力学 高能物理 - 理论

摘要

视觉语言模型在空间智能方面仍显得不足,表现不佳,尤其是在空间理解和推理任务上。我们将这一差距归因于缺乏能够从2D图像重建3D空间的视觉几何学习过程。我们提出了 G2^2VLM,一种几何 grounding 视觉语言模型,旨在桥接空间智能的两个基本方面:空间3D重建与空间理解。G2^2VLM 原生利用学习到的3D视觉几何特征,直接预测3D属性,并通过上下文学习和交错推理来增强空间推理任务。我们的统一设计在空间理解方面具有高度可扩展性:它可以在丰富的多视角图像和视频数据上训练,同时利用通常仅从难以收集的注释中获得的3D视觉先验。实验结果表明,G2^2VLM 在两项任务中都表现出色,能够实现与最先进的前馈3D重建模型相当的结果,在空间理解和推理任务中取得更好或相当的结果。通过将语义强大的 VLM 与低层3D视觉任务统一,我们希望 G2^2VLM 能作为社区的强大基线,并解锁更多未来应用,例如3D场景编辑。

关键词

引用

@article{arxiv.2511.21685,
  title  = {Holographically Emergent Gauge Theory in Symmetric Quantum Circuits},
  author = {Akash Vijay and Jong Yeon Lee},
  journal= {arXiv preprint arXiv:2511.21685},
  year   = {2026}
}