ARLBench:面向强化学习超参数优化的灵活高效基准测试
机器学习
2026-03-11 v2
摘要
超参数是可靠地训练高性能强化学习 (RL) 智能体的关键因素。遗憾的是,开发和评估用于调整此类超参数的自动化方法既昂贵又耗时。因此,此类方法通常仅在单一领域或算法上进行评估,这使得比较变得困难,并限制了对它们泛化能力的深入分析。我们提出了 ARLBench,一个用于 RL 中超参数优化 (HPO) 的基准测试,它允许比较各种 HPO 方法,同时在评估方面具有很高的效率。为了推动 RL 中 HPO 的研究,即使在计算资源较少的环境下也能进行,我们选择了一个涵盖各种算法和环境组合的 HPO 任务代表性子集。这一选择允许仅使用以前所需计算量的一小部分来生成自动化 RL (AutoRL) 方法的性能概况,从而使更广泛的研究人员能够开展 RL 中 HPO 的研究。凭借我们的选择所基于的关于超参数景观的广泛且大规模的数据集,ARLBench 成为 AutoRL 研究的一个高效、灵活且面向未来的基础。该基准测试和数据集均可在 https://github.com/automl/arlbench 获取。
引用
@article{arxiv.2409.18827,
title = {ARLBench: Flexible and Efficient Benchmarking for Hyperparameter Optimization in Reinforcement Learning},
author = {Jannis Becktepe and Julian Dierkes and Carolin Benjamins and Aditya Mohan and David Salinas and Raghu Rajan and Frank Hutter and Holger Hoos and Marius Lindauer and Theresa Eimer},
journal= {arXiv preprint arXiv:2409.18827},
year = {2026}
}