中文

ProRL 代理:用于多轮 LLM 代理 RL 训练的滚动即服务

人工智能 2026-03-20 v1

摘要

多轮 LLM 代理对于解决复杂、交互式任务至关重要,强化学习(RL)是提高其长期行为的关键要素。然而,RL 训练需要生成大量沙箱滚动轨迹,现有基础设施常将滚动编排与训练循环捆绑在一起,导致系统难以迁移和维护。基于滚动即服务(rollout-as-a-service)的理念,我们提出了 ProRL Agent ,一个可通过 API 服务提供完整代理滚动生命周期的可扩展基础设施。ProRL Agent 还提供标准化和可扩展的沙箱环境,支持在无根 HPC 环境中实现多样化的代理任务。我们通过在软件工程、数学、STEM 和编码任务上的 RL 训练验证了 ProRL Agent 。ProRL Agent 已开源并集成为 NVIDIA NeMo Gym 的一部分。

关键词

引用

@article{arxiv.2603.18815,
  title  = {ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents},
  author = {Hao Zhang and Mingjie Liu and Shaokun Zhang and Songyang Han and Jian Hu and Zhenghui Jin and Yuchi Zhang and Shizhe Diao and Ximing Lu and Binfeng Xu and Zhiding Yu and Jan Kautz and Yi Dong},
  journal= {arXiv preprint arXiv:2603.18815},
  year   = {2026}
}