Open RL Benchmark:强化学习的全面追踪实验
机器学习
2024-02-06 v1
摘要
在许多强化学习 (RL) 论文中,学习曲线是衡量 RL 算法有效性的有用指标。然而,学习曲线的完整原始数据很少可用。因此,通常有必要从头复现实验,这既耗时又容易出错。我们提出了 Open RL Benchmark,这是一组完全追踪的 RL 实验,不仅包含 episodic return 等常规数据,还包含所有算法特定指标和系统指标。Open RL Benchmark 由社区驱动:任何人都可以下载、使用并为数据做出贡献。截至撰写本文时,已追踪超过 25,000 次运行,累计时长超过 8 年。Open RL Benchmark 涵盖了广泛的 RL 库和参考实现。我们特别注重确保每个实验都能精确复现,不仅提供完整参数,还提供生成该实验所依赖的依赖项版本。此外,Open RL Benchmark 附带一个命令行界面 (CLI),便于获取数据和生成图表以展示结果。在本文档中,我们包含两个案例研究,以展示 Open RL Benchmark 在实际应用中的效用。据我们所知,Open RL Benchmark 是首个此类 RL 基准,作者希望它能改进并促进该领域研究人员的工作。
引用
@article{arxiv.2402.03046,
title = {Open RL Benchmark: Comprehensive Tracked Experiments for Reinforcement Learning},
author = {Shengyi Huang and Quentin Gallouédec and Florian Felten and Antonin Raffin and Rousslan Fernand Julien Dossa and Yanxiao Zhao and Ryan Sullivan and Viktor Makoviychuk and Denys Makoviichuk and Mohamad H. Danesh and Cyril Roumégous and Jiayi Weng and Chufan Chen and Md Masudur Rahman and João G. M. Araújo and Guorui Quan and Daniel Tan and Timo Klein and Rujikorn Charakorn and Mark Towers and Yann Berthelot and Kinal Mehta and Dipam Chakraborty and Arjun KG and Valentin Charraut and Chang Ye and Zichen Liu and Lucas N. Alegre and Alexander Nikulin and Xiao Hu and Tianlin Liu and Jongwook Choi and Brent Yi},
journal= {arXiv preprint arXiv:2402.03046},
year = {2024}
}
备注
Under review