中文

几何基础模型对视觉-语言-动作模型影响理解

计算机视觉与模式识别 2026-05-26 v1 机器人学

摘要

近期研究探索视觉-语言-动作模型 (VLA) 与几何基础模型 (GFM) 在 3D 重建方面的新机遇,如 VGGT。虽然所得几何 VLA 常显示出 improved performance,但仍不清楚 (i) 现代 VLA 是否已具备足够的几何理解才能从头开始,(ii) 将几何理解注入 VLA 的最佳架构是什么,以及 (iii) 其他影响几何 VLA 的设计选择的效果。本文提供严谨的实验分析以阐明这些问题,针对特定 VLA (GR00T-N1.5) 和 GFM (VGGT)。我们的第一个贡献是形式化化先前工作的直觉,表明当前 VLA 缺乏几何理解,通过提供基于线性探测的严谨分析。该分析首次量化了 VLA 与 GFM 之间的“几何间隙”。我们的第二个贡献是识别并比较不同的策略来桥接 GFMs 与 VLAs。我们实现了三种不同的架构,这些架构在将几何注入 VLA 的方式上有所不同,同时保持 low-level implementation details 尽可能相似,以确保公平比较。最后,我们分析了非架构选择(如训练数据、相机数量、重建质量)对几何 VLA 性能的影响。

关键词

引用

@article{arxiv.2605.24642,
  title  = {Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models},
  author = {Yurou Yang and Muyuan Lin and Roberto Martin-Martin and Martin Labrie and Shreekant Gayaka and Cheng-Hao Kuo and Luca Carlone},
  journal= {arXiv preprint arXiv:2605.24642},
  year   = {2026}
}