中文

GigaBrain-0.5M*:一种基于世界模型强化学习的 VLA 模型

计算机视觉与模式识别 2026-02-27 v2

摘要

直接从当前观察预测多步动作的视觉语言动作(VLA)模型因场景理解受限和未来预期能力弱而存在固有局限。相比之下,预训练于网络规模视频语料库的视频世界模型具有鲁明的时空推理和准确的未来预测能力,因而成为增强 VLA 学习的自然基础。因此,我们提出了通过世界模型强化学习训练的 VLA 模型 \textit{GigaBrain-0.5M*}。基于预训练于 10,000 小时机器人操纵数据集的 \textit{GigaBrain-0.5}(其中间版本目前在国际 RoboChallenge 基准测试中名列前茅),\textit{GigaBrain-0.5M*} 进一步集成了基于世界模型的强化学习方法 \textit{RAMP}(Reinforcement leArning via world Model-conditioned Policy),以实现稳健的跨任务适应。实证结果表明,\textit{RAMP} 在 \texttt{Laundry Folding}、\texttt{Box Packing} 和 \texttt{Espresso Preparation} 等具有挑战性的任务上相较于 RECAP 基线实现了约 30\% 的性能提升。关键的是,\textit{GigaBrain-0.5M^*} 在实际部署视频中表现出可靠的长期程执行能力,持续完成复杂的操作任务且未出现失败,验证了其在项目页面上的实际应用效果。

关键词

引用

@article{arxiv.2602.12099,
  title  = {GigaBrain-0.5M*: a VLA That Learns From World Model-Based Reinforcement Learning},
  author = {GigaBrain Team and Boyuan Wang and Bohan Li and Chaojun Ni and Guan Huang and Guosheng Zhao and Hao Li and Jie Li and Jindi Lv and Jingyu Liu and Lv Feng and Mingming Yu and Peng Li and Qiuping Deng and Tianze Liu and Xinyu Zhou and Xinze Chen and Xiaofeng Wang and Yang Wang and Yifan Li and Yifei Nie and Yilong Li and Yukun Zhou and Yun Ye and Zhichao Liu and Zheng Zhu},
  journal= {arXiv preprint arXiv:2602.12099},
  year   = {2026}
}

备注

https://gigabrain05m.github.io/