GraspVLA:一个基于十亿级合成动作数据预训练的抓取基础模型
机器人学
2025-08-28 v3
摘要
具身基础模型因其零样本泛化能力、可扩展性以及通过少样本后训练适应新任务的能力而受到越来越多的关注。然而,现有模型严重依赖真实世界数据,这些数据的收集成本高昂且耗费人力。合成数据提供了一种经济高效的替代方案,但其潜力在很大程度上仍未得到充分探索。为弥合这一差距,我们探索了完全使用大规模合成动作数据训练视觉-语言-动作模型的可行性。我们构建了SynGrasp-1B,这是一个在仿真中生成的、具有照片级真实感渲染和广泛域随机化的十亿帧机器人抓取数据集。在此基础上,我们提出了GraspVLA,这是一个在大规模合成动作数据上预训练的VLA模型,作为抓取任务的基础模型。GraspVLA将自回归感知任务和基于流匹配的动作生成整合到一个统一的思维链过程中,从而能够在合成动作数据和互联网语义数据上进行联合训练。这种设计有助于缩小仿真到现实的差距,并促进将学习到的动作迁移到更广泛的互联网覆盖对象上,实现抓取中的开放词汇泛化。在真实世界和仿真基准上的广泛评估证明了GraspVLA先进的零样本泛化能力以及对特定人类偏好的少样本适应能力。我们将发布SynGrasp-1B数据集和预训练权重,以惠及社区。
引用
@article{arxiv.2505.03233,
title = {GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data},
author = {Shengliang Deng and Mi Yan and Songlin Wei and Haixin Ma and Yuxin Yang and Jiayi Chen and Zhiqi Zhang and Taoyu Yang and Xuheng Zhang and Wenhao Zhang and Heming Cui and Zhizheng Zhang and He Wang},
journal= {arXiv preprint arXiv:2505.03233},
year = {2025}
}