Being-H0:基于大规模人类视频的视觉-语言-动作预训练
计算机视觉与模式识别
2025-07-22 v1 机器学习
机器人学
摘要
我们介绍 Being-H0,一种基于大规模人类视频训练的灵巧视觉-语言-动作模型 (VLA)。现有的 VLA 在需要高灵活性的复杂操作任务上表现不佳,且对新情景和新任务的泛化能力差,这主要源于其依赖合成数据存在显著的仿真-现实鸿沟,或依赖teleoperated演示数据规模和多样性不足。为解决数据瓶颈,我们提出利用人类手部作为基础操作机械手,充分利用网页数据中呈现的丰富灵活性和可扩展性。我们的方法核心是物理指令调谐,这是一种新的训练范式,将大规模 VLA 从人类视频中进行预训练、进行3D推理的物理空间对齐,以及针对机器人任务的后训练适应。此外,我们引入一种部件级运动词元化方法,实现毫米级的重建精度,用于建模精确的手部轨迹以进行动作学习。为支持我们提出的范式,我们进一步开发了综合性的数据 curated 流程,将包括 motion capture、VR 和仅 RGB 视频等异构数据源整合为大规模数据集,包含数百万个基于运动的指令实例。我们实证表明,Being-H0 在手部运动生成和指令跟随方面表现卓越,并且在模型和数据规模方面具有良好的可扩展性。重要的是,我们观察到在实际机器人操作中应用物理指令调谐后,Being-H0 能够获得预期的提升。更多细节请参见 https://beingbeyond.github.io/Being-H0。
引用
@article{arxiv.2507.15597,
title = {Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos},
author = {Hao Luo and Yicheng Feng and Wanpeng Zhang and Sipeng Zheng and Ye Wang and Haoqi Yuan and Jiazheng Liu and Chaoyi Xu and Qin Jin and Zongqing Lu},
journal= {arXiv preprint arXiv:2507.15597},
year = {2025}
}
备注
37 pages