中文

在线调整混合输入超参数以实现高效的基于种群的AutoRL

机器学习 2021-07-01 v1

摘要

尽管强化学习(RL)近期取得了一系列成功,许多RL算法对超参数仍保持敏感。因此,近期AutoRL领域受到关注,其旨在自动化设计决策以创建更通用的算法。近期工作表明,基于种群的方法通过学习在线超参数调度可能是有效的AutoRL算法。特别地,PB2算法通过将在线超参数优化表述为时变GP-bandit问题,同时在RL任务中实现强劲性能,并提供理论保证。然而,PB2仅被设计用于连续超参数,这严重限制了其实际效用。在本文中,我们引入一种新的(可证明)高效的分层方法,用于优化连续和类别变量,使用一种专为基于种群的训练机制设计的新时变bandit算法。我们在具有挑战性的Procgen基准上评估我们的方法,表明显式建模数据增强与其他超参数之间的依赖性可改善泛化能力。

关键词

引用

@article{arxiv.2106.15883,
  title  = {Tuning Mixed Input Hyperparameters on the Fly for Efficient Population Based AutoRL},
  author = {Jack Parker-Holder and Vu Nguyen and Shaan Desai and Stephen Roberts},
  journal= {arXiv preprint arXiv:2106.15883},
  year   = {2021}
}