利用Kronecker因子分解近似实现深度强化学习的可扩展置信域方法
高能天体物理现象
2017-08-18 v1
摘要
在本工作中,我们提出将置信域优化应用于深度强化学习,采用最近提出的Kronecker因子分解近似来逼近曲率。我们扩展了自然策略梯度的框架,并提出使用带有置信域的Kronecker因子分解近似曲率(K-FAC)来同时优化执行者和评论者;因此我们将我们的方法称为使用Kronecker因子分解置信域的执行者-评论者算法(ACKTR)。据我们所知,这是用于执行者-评论者方法的首个可扩展的置信域自然梯度方法。该方法也能直接从原始像素输入中学习连续控制以及离散控制策略中的非平凡任务。我们在Atari游戏的离散域和MuJoCo环境的连续域中测试了我们的方法。与先前SOTA的on-policy执行者-评论者方法相比,采用所提方法我们能够获得更高的奖励,且平均样本效率提高2至3倍。代码可在 https://github.com/openai/baselines 获取
引用
@article{arxiv.1708.05143,
title = {Modeling the response of a standard accretion disc to stochastic viscous fluctuations},
author = {Naveel Ahmad and Ranjeev Misra and Naseer Iqbal and Bari Maqbool and Mubashir Hamid},
journal= {arXiv preprint arXiv:1708.05143},
year = {2017}
}
备注
17 pages, 9 figures