策略梯度的快速高效超参数调优
机器学习
2019-09-19 v2 机器学习
摘要
策略梯度方法的性能对超参数设置敏感,任何新应用都必须对其调优。广泛使用的网格搜索调优方法样本效率低且计算昂贵。诸如基于种群的训练(Population Based Training)等更先进的方法学习超参数的最优调度而非固定设置,可取得更好结果,但同样样本效率低且计算昂贵。本文提出飞行超参数优化(HOOF),一种无梯度算法,仅需不超过一次训练运行即可通过梯度直接自适应影响策略更新的超参数。其主要思想是利用策略梯度方法已采样的轨迹来优化单步改进目标,从而产生一种样本与计算高效的易实现算法。我们在多个领域与算法上的实验结果表明,使用HOOF学习这些超参数调度可带来更快的学习与更优的性能。
引用
@article{arxiv.1902.06583,
title = {Fast Efficient Hyperparameter Tuning for Policy Gradients},
author = {Supratik Paul and Vitaly Kurin and Shimon Whiteson},
journal= {arXiv preprint arXiv:1902.06583},
year = {2019}
}
备注
NeurIPS 2019