中文

VGGT-DP:基于视觉基础模型的可泛化机器人控制

机器人学 2025-09-24 v1 人工智能

摘要

视觉模仿学习框架允许机器人从专家演示中学习操作技能。现有方法主要关注策略设计,往往忽略了视觉编码器的结构和容量,从而限制了空间理解与泛化能力。受生物视觉系统依赖视觉和本体感觉线索进行鲁棒控制的启发,我们提出了 VGGT-DP,这是一种视觉运动策略框架,将来自预训练 3D 感知模型的几何先验与本体感觉反馈相结合。我们采用 Visual Geometry Grounded Transformer (VGGT) 作为视觉编码器,并引入本体感觉引导的视觉学习策略,以使感知与内部机器人状态对齐,从而改善空间定位和闭环控制。为了降低推理延迟,我们设计了一种逐帧 token 复用机制,将多视图 token 压缩为高效的空间表示。我们进一步应用随机 token 剪枝以增强策略鲁棒性并减少过拟合。在具有挑战性的 MetaWorld 任务上的实验表明,VGGT-DP 显著优于 DP 和 DP3 等强基线,特别是在精度要求高和长周期的场景中。

关键词

引用

@article{arxiv.2509.18778,
  title  = {VGGT-DP: Generalizable Robot Control via Vision Foundation Models},
  author = {Shijia Ge and Yinxin Zhang and Shuzhao Xie and Weixiang Zhang and Mingcai Zhou and Zhi Wang},
  journal= {arXiv preprint arXiv:2509.18778},
  year   = {2025}
}

备注

submitted to AAAI 2026