中文

RynnVLA-002:统一的视觉语言动作与世界模型

机器人学 2025-11-25 v2

摘要

我们介绍RynnVLA-002,一种统一的视觉语言动作(Vision-Language-Action, VLA)和世界模型。世界模型利用动作和视觉输入预测未来图像状态,学习环境的底层物理,以细化动作生成。相反,VLA模型从图像观察中产生后续动作,增强视觉理解,支持世界模型的图像生成。RynnVLA-002的统一框架使环境动力学和动作规划能够联合学习。我们的实验表明,RynnVLA-002优于单独的VLA和世界模型,显示出它们的相互增强。我们在仿真和真实世界机器人任务中评估了RynnVLA-002。RynnVLA-002在LIBERO仿真基准测试中无需预训练即可达到97.4%的成功率;在真实世界的LeRobot实验中,其集成世界模型使整体成功率提升50%。

关键词

引用

@article{arxiv.2511.17502,
  title  = {RynnVLA-002: A Unified Vision-Language-Action and World Model},
  author = {Jun Cen and Siteng Huang and Yuqian Yuan and Kehan Li and Hangjie Yuan and Chaohui Yu and Yuming Jiang and Jiayan Guo and Xin Li and Hao Luo and Fan Wang and Deli Zhao and Hao Chen},
  journal= {arXiv preprint arXiv:2511.17502},
  year   = {2025}
}