中文

基于种群的 Bandit 算法实现可证明高效的在线超参数优化

机器学习 2021-06-07 v4 机器学习

摘要

机器学习近期的许多成功都依赖于良好调优的超参数。这在强化学习 (RL) 中尤为突出,因为配置的微小改变就可能导致失败。尽管调优超参数十分重要,但它仍然代价高昂,且常以朴素而繁琐的方式进行。近期对此问题的一种解决方案是种群基训练 (PBT),它在一次种群智能体的训练运行中同时更新权重与超参数。PBT 已被证明在 RL 中特别有效,从而在该领域得到广泛使用。然而,PBT 缺乏理论保证,因为它依赖随机启发式来探索超参数空间。这种低效意味着它通常需要庞大的计算资源,这对许多中小型实验室而言难以承受。在本工作中,我们引入了首个可证明高效的 PBT 风格算法——基于种群的 Bandit (PB2)。PB2 使用概率模型高效地引导搜索,从而能以远少于 PBT 通常所需智能体数量发现高性能超参数配置。我们在一系列 RL 实验中表明,PB2 能够以适度的计算预算实现高性能。

关键词

引用

@article{arxiv.2002.02518,
  title  = {Provably Efficient Online Hyperparameter Optimization with Population-Based Bandits},
  author = {Jack Parker-Holder and Vu Nguyen and Stephen Roberts},
  journal= {arXiv preprint arXiv:2002.02518},
  year   = {2021}
}

备注

Camera-ready version, NeurIPS 2020