中文

基于进化策略的离策略学习在线超参数调优

机器学习 2020-06-16 v1 神经与进化计算 机器学习

摘要

众所周知,离策略学习算法对超参数的选择非常敏感。然而,与可以通过元梯度等方法优化超参数的近策略算法不同,类似技术无法直接应用于离策略学习。在这项工作中,我们提出了一个框架,该框架将进化策略应用于离策略学习中的在线超参数调优。我们的公式与元梯度建立了密切联系,并利用了黑箱优化在相对低维搜索空间中的优势。我们证明,在广泛的连续控制基准测试中,我们的方法优于使用静态超参数的最新离策略学习基线方法以及近期先前的工作。

关键词

引用

@article{arxiv.2006.07554,
  title  = {Online Hyper-parameter Tuning in Off-policy Learning via Evolutionary Strategies},
  author = {Yunhao Tang and Krzysztof Choromanski},
  journal= {arXiv preprint arXiv:2006.07554},
  year   = {2020}
}