Cleanba:一个可复现且高效的分布式强化学习平台
机器学习
2023-10-03 v1
摘要
分布式深度强化学习(DRL)旨在利用更多计算资源以更短的训练时间训练自主智能体。尽管该领域近期取得了进展,可复现性问题尚未得到充分探讨。本文首先表明,即便控制超参数,典型的 actor-learner 框架仍可能存在可复现性问题。随后我们介绍 Cleanba,一个用于分布式 DRL 的新型开源平台,其提出了一种高度可复现的架构。Cleanba 实现了高度优化的 PPO 和 IMPALA 的分布式变体。我们的 Atari 实验表明,这些变体能够获得与 moolib 和 torchbeast 中的强 IMPALA 基线以及 CleanRL 中的 PPO 基线相当或更高的分数。然而,Cleanba 变体呈现出 1)更短的训练时间以及 2)在不同硬件设置下更具可复现性的学习曲线。Cleanba 的源代码可在 \url{https://github.com/vwxyzjn/cleanba} 获取。
引用
@article{arxiv.2310.00036,
title = {Cleanba: A Reproducible and Efficient Distributed Reinforcement Learning Platform},
author = {Shengyi Huang and Jiayi Weng and Rujikorn Charakorn and Min Lin and Zhongwen Xu and Santiago Ontañón},
journal= {arXiv preprint arXiv:2310.00036},
year = {2023}
}