RLinf-USER:面向具身 AI 的真实在线策略学习的统一可扩展系统
机器人学
2026-02-13 v3
摘要
在物理世界中直接进行在线策略学习是具身智能的一个具有前景但又充满挑战的方向。与仿真不同,真实世界系统无法任意加速、廉价重置或大规模复制,这使得可扩展的数据收集、异构部署和长期有效训练变得困难。这些挑战表明,真实世界的策略学习不仅是一个算法问题,更是一个根本上的系统问题。我们提出了 USER(Unified and extensible SystEm for Real-world online policy learning),一个面向真实在线策略学习的统一可扩展系统。USER 将物理机器人作为首级硬件资源,与 GPU 共同通过统一的硬件抽象层,实现对异构机器人的自动发现、管理和调度。为解决云端-边缘通信问题,USER引入了具有隧道式网络的自适应通信平面、用于流量局部化的分布式数据通道,以及面向 GPU 端开销的流式多处理器感知权重同步。在此基础设施之上,USER将学习组织为一个完全非阻塞的框架,配备持久的、面向缓存的缓冲区,实现高效的长期实验,具备稳健的崩溃恢复能力和历史数据的复用。此外,USER提供可扩展的奖励、算法和策略抽象,支持 CNN/MLP、生成式策略以及大型视觉-语言-动作(VLA)模型的在线模仿学习或强化学习。仿真和真实环境中的结果表明,USER实现了多机器人协调、异构操作臂、边缘-云协作大型模型以及长期非阻塞训练,为真实世界在线策略学习提供了统一可扩展的系统基础。
引用
@article{arxiv.2602.07837,
title = {RLinf-USER: A Unified and Extensible System for Real-World Online Policy Learning in Embodied AI},
author = {Hongzhi Zang and Shu'ang Yu and Hao Lin and Tianxing Zhou and Zefang Huang and Zhen Guo and Xin Xu and Jiakai Zhou and Yuze Sheng and Shizhe Zhang and Feng Gao and Wenhao Tang and Yufeng Yue and Quanlu Zhang and Xinlei Chen and Chao Yu and Yu Wang},
journal= {arXiv preprint arXiv:2602.07837},
year = {2026}
}