中文

基于进化策略学习探索参数分布的元强化学习方法

机器学习 2019-05-09 v2 人工智能 机器学习

摘要

本文提出了一种强化学习设定下的新型元学习方法,该方法基于进化策略(ES)、参数空间探索与确定性策略梯度。ES方法易于并行化,这对于现代训练架构是理想的;然而,此类方法通常需要大量样本才能有效训练。我们在适应阶段使用确定性策略梯度及其他技术,以弥补样本效率问题,同时保持ES方法固有的可扩展性。我们证明,在MuJoCo模拟器的高维控制任务中,与基于梯度的元学习相比,我们的方法取得了良好结果。此外,由于在元训练阶段采用无梯度方法,其不需要适应训练中关于梯度和策略的信息,我们预测并证实了我们的算法在需要多步适应的任务中表现更优。

关键词

引用

@article{arxiv.1812.11314,
  title  = {Meta Reinforcement Learning with Distribution of Exploration Parameters Learned by Evolution Strategies},
  author = {Yiming Shen and Kehan Yang and Yufeng Yuan and Simon Cheng Liu},
  journal= {arXiv preprint arXiv:1812.11314},
  year   = {2019}
}