高斯过程策略优化
机器学习
2020-03-03 v1 机器学习
摘要
我们提出了一种新颖的 actor-critic、无模型强化学习算法,其采用贝叶斯参数空间探索方法来求解环境。使用一个高斯过程来学习给定策略参数下策略的期望回报。该系统通过使用基于近端策略优化(Proximal Policy Optimization)'Clipped' 损失函数与表示由高斯过程给出的期望改进采集函数的奖励项组成的新代理损失函数进行梯度下降来更新参数进行训练。这一新方法被证明在利用 MuJoCo 物理引擎模拟机器人运动的环墶中与当前算法相当,且有时在经验上优于当前算法。
引用
@article{arxiv.2003.01074,
title = {Gaussian Process Policy Optimization},
author = {Ashish Rao and Bidipta Sarkar and Tejas Narayanan},
journal= {arXiv preprint arXiv:2003.01074},
year = {2020}
}