中文

RLinf-VLA:视觉-语言-动作模型强化学习的统一高效框架

机器人学 2026-02-10 v2

摘要

视觉-语言-动作(VLA)模型的最新进展推动了其能力向具身设置的扩展,其中强化学习(RL)提供了一种通过交互来优化任务成功的原则性方法。然而,现有方法仍然碎片化,缺乏跨架构和算法的公平比较的统一平台以及可扩展训练的高效系统设计。为了应对这些挑战,我们引入了RLinf-VLA,一个用于VLA模型可扩展RL训练的统一高效框架。RLinf-VLA通过提供统一接口来实现统一,该接口标准化了多样化VLA架构、多种RL算法和异构模拟器的集成,从而实现可扩展性。为确保效率,该系统采用灵活的资源分配架构来处理RL流水线中的渲染、推理和训练工作负载。特别是,对于GPU并行模拟器,RLinf-VLA引入了一种混合细粒度流水线分配策略,实现了1.61倍至1.88倍的训练加速。使用这一统一系统,通过RLinf-VLA训练的模型在多个仿真基准测试(包括LIBERO、ManiSkill和RoboTwin)中表现出约20-85%的一致性能提升。此外,我们总结了有效RL-based VLA训练的训练实践集合。我们将RLinf-VLA定位为实现高效、统一和可复现的具身智能研究的基础系统。

关键词

引用

@article{arxiv.2510.06710,
  title  = {RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models},
  author = {Hongzhi Zang and Mingjie Wei and Si Xu and Yongji Wu and Zhen Guo and Yuanqing Wang and Hao Lin and Peihong Wang and Liangzhi Shi and Yuqing Xie and Zhexuan Xu and Zhihao Liu and Kang Chen and Wenhao Tang and Quanlu Zhang and Weinan Zhang and Chao Yu and Yu Wang},
  journal= {arXiv preprint arXiv:2510.06710},
  year   = {2026}
}

备注

This is the technical report of the RLinf Team, focusing on the algorithm side. For the system-level design, please refer to arXiv:2509.15965 . The open-sourced code link: https://github.com/RLinf/RLinf