中文

SRL:将分布式强化学习扩展至超一万个核心

分布式、并行与集群计算 2024-06-24 v3 人工智能 机器学习

摘要

强化学习(RL)任务日益增长的复杂性要求分布式系统高效地生成并处理海量数据。然而,现有的开源库存在各种局限,阻碍了它们在需要大规模训练的困难场景中的实际应用。本文中,我们提出了一种关于 RL 训练数据流的新抽象,将多样的 RL 训练应用统一为通用框架。遵循该抽象,我们开发了名为 ReaLlyScalableRL 的可扩展、高效且可扩展的分布式 RL 系统,其支持高效且大规模并行的训练以及自定义算法的便捷开发。我们的评估表明,SRL 优于现有学术库,在分布式环境下最高达到 21 倍的训练吞吐率。在学习性能方面,除在不同 RL 算法下于常见 RL 基准上表现良好且可扩展外,SRL 还能在挑战性的捉迷藏环境中以最多 5 倍挂钟时间加速复现 OpenAI 所报道的相同解。值得注意的是,SRL 是学术界首个以超 15k CPU 核心的大规模进行 RL 实验的系统。SRL 源代码见:https://github.com/openpsi-project/srl 。

关键词

引用

@article{arxiv.2306.16688,
  title  = {SRL: Scaling Distributed Reinforcement Learning to Over Ten Thousand Cores},
  author = {Zhiyu Mei and Wei Fu and Jiaxuan Gao and Guangju Wang and Huanchen Zhang and Yi Wu},
  journal= {arXiv preprint arXiv:2306.16688},
  year   = {2024}
}

备注

Published at ICLR 2024. 10 pages (24 pages with references and appendix), 7 figures