面向高效 LLM 多智能体强化学习的 rollout-训练联合设计
机器学习
2026-02-11 v1
摘要
尽管多智能体强化学习(MARL)在算法层面取得了创新,但大规模 MARL 训练所依赖的网络基础设施仍鲜有探索。现有训练框架主要针对单智能体场景进行优化,无法解决 MARL 独有的系统层面挑战,包括 rollout-训练同步瓶颈、rollout 负载不均衡以及训练资源 underutilization。为弥合这一差距,我们提出了 FlexMARL——首个端到端优化 rollout、训练及其编排的框架,以实现大规模基于 LLM 的 MARL。具体而言,FlexMARL 引入联合调度器,在 rollout-训练解耦架构下管理数据流。基于经验存储库,一种新型微批驱动的异步管道消除了同步瓶颈,同时提供强一致性保证。rollout 引擎采用并行抽样方案结合层次负载平衡,适应不均衡的智能体间/内请求模式。训练引擎通过智能体中心的资源分配实现按需硬件绑定。不同智能体的训练状态通过统一且位置无关的通信进行交换。实验在大规模生产集群上表明,FlexMARL 相较于现有框架实现了最高 7.3 倍加速,并将硬件利用率提高最高 5.6 倍。
引用
@article{arxiv.2602.09578,
title = {Rollout-Training Co-Design for Efficient LLM-Based Multi-Agent Reinforcement Learning},
author = {Zhida Jiang and Zhaolong Xing and Jiawei Lu and Yipei Niu and Qingyuan Sang and Liangxu Zhang and Wenquan Dai and Junhua Shu and Jiaxing Wang and Qiangyu Pei and Qiong Chen and Xinyu Liu and Fangming Liu and Ai Han and Zhen Chen and Ke Zhang},
journal= {arXiv preprint arXiv:2602.09578},
year = {2026}
}