中文

松弛任务间依赖的高度并行化强化学习训练

机器学习 2025-02-28 v1 人工智能

摘要

随着对优质智能体需求的提升,深度强化学习 (Deep Reinforcement Learning, DRL) 的训练复杂度也随之升高。因此,加速 DRL 训练已成为主要研究焦点。将 DRL 训练过程划分为子任务并采用并行计算可有效降低训练成本。然而,当前 DRL 训练系统因子任务组件之间的数据分配问题缺乏足够的并行化。这一分配问题常被忽视,但若加以解决,可进一步提升训练效率。因此,我们提出了高吞吐分布式 RL 训练系统 TianJi。它放宽子任务组件间的分配依赖,实现事件驱动的异步通信。同时,TianJi 保持子任务组件间的清晰边界。为解决因放宽分配依赖导致的收敛不确定性,TianJi 提出一种基于样本生产与消费平衡的分布式策略。该策略控制样本的延迟,以纠正其质量,确保收敛。我们进行了大量实验。TianJi 在与相关对比系统相比的收敛时间加速比最高可达 4.37 倍。在扩展至八个计算节点后,TianJi 相对于 XingTian 实现了收敛时间加速 1.6 倍、吞吐量加速 7.13 倍,显示出提升训练效率与可扩展性的能力。在数据传输效率实验中,TianJi 显著优于其他系统,接近硬件极限。TianJi 也在策略梯度算法中展现有效性,相较 RLlib 与 XingTian 实现了收敛时间加速比分别为 4.36 倍和 2.95 倍。TianJi 代码已开源于 https://github.com/HiPRL/TianJi.git。

关键词

引用

@article{arxiv.2502.20190,
  title  = {Highly Parallelized Reinforcement Learning Training with Relaxed Assignment Dependencies},
  author = {Zhouyu He and Peng Qiao and Rongchun Li and Yong Dou and Yusong Tan},
  journal= {arXiv preprint arXiv:2502.20190},
  year   = {2025}
}