中文

GeoPredict:利用预测运动学与 3D 高斯几何实现精确 VLA 操作

计算机视觉与模式识别 2026-04-08 v2 机器人学

摘要

视觉-语言-动作(VLA)模型在机器人操作中实现了较强的泛化能力,但主要仍是反应式的且以 2D 为中心,使其在需要精确 3D 推理的任务中不可靠。我们提出 GeoPredict,一个几何感知的 VLA 框架,通过预测运动学和几何先验增强连续动作策略。GeoPredict 引入一个轨迹级模块来编码运动历史并预测机器人手臂的多步 3D 关键点轨迹,以及一个预测性 3D 高斯几何模块,通过沿未来关键点轨迹的轨迹引导精化来预测工作空间几何。这些预测模块仅通过基于深度的渲染作为训练时的监督信号,而推理仅需轻量级的额外查询令牌,无需调用任何 3D 解码。在 RoboCasa Human-50、LIBERO 和真实世界操作任务上的实验表明,GeoPredict 持续优于强 VLA 基线,尤其在几何密集型和空间要求高的场景中。

关键词

引用

@article{arxiv.2512.16811,
  title  = {GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation},
  author = {Jingjing Qian and Boyao Han and Chen Shi and Lei Xiao and Long Yang and Shaoshuai Shi and Li Jiang},
  journal= {arXiv preprint arXiv:2512.16811},
  year   = {2026}
}