基于模型探索的策略优化
机器学习
2018-11-20 v1 机器学习
摘要
近端策略优化算法(PPO)等无模型强化学习方法已成功应用于雅达利游戏等复杂决策问题。然而,这些方法存在高方差和高样本复杂度的问题。另一方面,学习转移动力学的基于模型的强化学习方法具有更高的样本效率,但它们常常受到转移估计偏差的困扰。如何利用基于模型和无模型学习是强化学习中的一个核心问题。在本文中,我们提出了一种新方法来解决探索与利用之间的权衡,该方法将无模型估计与基于模型估计之间的差异视为探索价值的度量。我们将这一新技术应用于PPO算法,得到了一种名为基于模型探索的策略优化(POME)的新策略优化方法。POME使用两个分量来预测动作的目标值:一个是通过蒙特卡洛采样估计的无模型分量,另一个是学习转移模型并预测下一状态价值的基于模型的分量。POME将这两种目标估计的误差作为每个状态-动作对的额外探索价值,即鼓励算法探索那些难以估计、目标误差较大的状态。我们在雅达利2600游戏上将POME与PPO进行比较,结果表明在49款游戏中的33款上POME优于PPO。
引用
@article{arxiv.1811.07350,
title = {Policy Optimization with Model-based Explorations},
author = {Feiyang Pan and Qingpeng Cai and An-Xiang Zeng and Chun-Xiang Pan and Qing Da and Hualin He and Qing He and Pingzhong Tang},
journal= {arXiv preprint arXiv:1811.07350},
year = {2018}
}
备注
Accepted at AAAI-19