中文

强化学习中的超参数及其调优方法

机器学习 2023-06-05 v1

摘要

为了提高可复现性,深度强化学习(RL)已采用更好的科学实践,如标准化评估指标和报告。然而,超参数优化的过程在各论文之间仍存在很大差异,这使得公平比较RL算法变得困难。在本文中,我们展示了RL中的超参数选择会显著影响智能体的最终性能和样本效率,并且超参数景观可能强烈依赖于调优种子,从而导致过拟合。因此我们建议采用AutoML中既有的最佳实践,例如分离调优种子与测试种子,以及在广泛搜索空间上进行有原则的超参数优化(HPO)。我们通过在一系列RL算法和环境上将多种最先进的HPO工具与其手工调优的对应版本进行比较来支持这一点,证明HPO方法通常具有更高性能和更低计算开销。基于我们的发现,我们为RL社区推荐了一套最佳实践,其应能以更少的计算成本产生更强的实证结果、更好的可复现性,从而加速进展。为鼓励采用这些实践,我们在 https://github.com/facebookresearch/how-to-autorl 提供了本文所用调优算法的即插即用实现。

关键词

引用

@article{arxiv.2306.01324,
  title  = {Hyperparameters in Reinforcement Learning and How To Tune Them},
  author = {Theresa Eimer and Marius Lindauer and Roberta Raileanu},
  journal= {arXiv preprint arXiv:2306.01324},
  year   = {2023}
}