ElegantRL-Podracer:面向云原生深度强化学习的可扩展弹性库
机器学习
2022-04-05 v2 人工智能
分布式、并行与集群计算
摘要
深度强化学习(DRL)已在游戏博弈与机器人控制等应用中的学习与执行方面带来变革。数据收集(即由智能体-环境交互产生转移样本)的成本仍是 DRL 在复杂现实问题中更广泛应用的主要挑战。遵循云原生范式在 GPU 云平台上训练 DRL 智能体是一种有前景的解决方案。本文中,我们提出一个可扩展且弹性的云原生深度强化学习库 ElegantRL-podracer,其高效支持数百万 GPU 核心在多个层级上开展大规模并行训练。在高层,ElegantRL-podracer 采用基于锦标赛的集成方案来编排数百甚至数千个 GPU 上的训练过程,调度排行榜与含数百个 pod 的训练池之间的交互。在低层,每个 pod 通过充分利用单个 GPU 中近 7000 个 GPU CUDA 核心来并行模拟智能体-环境交互。我们的 ElegantRL-podracer 库遵循容器化、微服务和 MLOps 的开发原则,具有高可扩展性、弹性和可访问性。利用 NVIDIA DGX SuperPOD 云,我们在运动控制与股票交易等多种任务上进行了广泛实验,结果表明 ElegantRL-podracer 大幅优于 RLlib。我们的代码已在 GitHub 上公开。
引用
@article{arxiv.2112.05923,
title = {ElegantRL-Podracer: Scalable and Elastic Library for Cloud-Native Deep Reinforcement Learning},
author = {Xiao-Yang Liu and Zechu Li and Zhuoran Yang and Jiahao Zheng and Zhaoran Wang and Anwar Walid and Jian Guo and Michael I. Jordan},
journal= {arXiv preprint arXiv:2112.05923},
year = {2022}
}
备注
9 pages, 7 figures