中文

离线强化学习的超参数选择

机器学习 2020-07-20 v1 人工智能 机器学习

摘要

离线强化学习(仅从记录数据进行的 RL)是在现实场景中部署 RL 技术的重要途径。然而,现有的离线 RL 超参数选择方法通过在环境中评估对应于各超参数设置的策略,打破了离线假设。这种在线执行通常不可行,因而削弱了离线 RL 的主要目标。因此,在本工作中,我们关注离线超参数选择,即仅给定记录数据时,从使用不同超参数训练的多个策略中选出最优策略的方法。通过大规模实证评估,我们表明:1)离线 RL 算法对超参数选择不鲁棒;2)诸如离线 RL 算法与 Q 值估计方法等因素会对超参数选择产生很大影响;3)当我们仔细控制这些因素时,可以可靠地对不同超参数选择下的策略进行排序,从而选出接近该集合中最佳策略的策略。总体而言,我们的结果呈现出一种乐观看法:即使在具有像素观测、高维动作空间与长周期的挑战性任务中,离线超参数选择也在可及范围之内。

关键词

引用

@article{arxiv.2007.09055,
  title  = {Hyperparameter Selection for Offline Reinforcement Learning},
  author = {Tom Le Paine and Cosmin Paduraru and Andrea Michi and Caglar Gulcehre and Konrad Zolna and Alexander Novikov and Ziyu Wang and Nando de Freitas},
  journal= {arXiv preprint arXiv:2007.09055},
  year   = {2020}
}