中文

Being-H0.5: 扩展以人为中心的机器人学习以实现跨本体泛化

机器人学 2026-01-21 v1

摘要

我们介绍了 Being-H0.5,这是一个基础视觉-语言-动作 (Vision-Language-Action, VLA) 模型,旨在实现跨不同机器人平台的稳健跨本体泛化。虽然现有的 VLA 经常在形态异质性和数据稀缺方面遇到困难,但我们提出了一种以人为中心的学习范式,将人类交互轨迹视为物理交互的通用“母语”。为了支持这一点,我们提出了 UniHand-2.0,这是迄今为止最大的具身预训练方案,包含跨越 30 种不同机器人本体的超过 35,000 小时的多模态数据。我们的方法引入了统一动作空间,将异构机器人控制映射到语义对齐的槽中,使低资源机器人能够从人类数据和高资源平台中自举技能。建立在这个以人为中心的基础之上,我们设计了一个统一的序列建模和多任务预训练范式,以弥合人类演示与机器人执行之间的差距。在架构上,Being-H0.5 采用了 Mixture-of-Transformers 设计,其特点是一个新颖的 Mixture-of-Flow (MoF) 框架,用于将共享的运动基元与特定于本体的专家解耦。最后,为了使跨本体策略在现实世界中保持稳定,我们引入了流形保持门控以增强在传感器偏移下的鲁棒性,并引入了通用异步分块以在不同延迟和控制配置的本体之间普及分块控制。我们通过实验证明,Being-H0.5 在模拟基准(如 LIBERO (98.9%) 和 RoboCasa (53.9%))上取得了 SOTA 结果,同时在五个机器人平台上展现出强大的跨本体能力。

关键词

引用

@article{arxiv.2601.12993,
  title  = {Being-H0.5: Scaling Human-Centric Robot Learning for Cross-Embodiment Generalization},
  author = {Hao Luo and Ye Wang and Wanpeng Zhang and Sipeng Zheng and Ziheng Xi and Chaoyi Xu and Haiweng Xu and Haoqi Yuan and Chi Zhang and Yiqing Wang and Yicheng Feng and Zongqing Lu},
  journal= {arXiv preprint arXiv:2601.12993},
  year   = {2026}
}

备注

44 pages