中文

V-MPO:面向离散与连续控制的策略上最大后验策略优化

人工智能 2019-09-27 v1 机器学习

摘要

深度强化学习在离散与连续控制的挑战性领域中最成功的一些应用,采用了策略上设定中的策略梯度方法。然而,策略梯度可能受大方差影响而限制性能,并且在实践中需要精心调节的熵正则化以防止策略崩溃。作为策略梯度算法的替代,我们引入了V-MPO,即最大后验策略优化(MPO)的策略上适配版本,它基于学到的状态值函数执行策略迭代。我们展示了V-MPO在多任务设定中超越了此前报道的Atari-57和DMLab-30基准测试套件的分数,并且无需重要性加权、熵正则化或基于种群的超参数调优即可可靠地做到。在单独的DMLab和Atari关卡上,所提算法可达到远高于此前报道的分数。V-MPO也适用于高维连续动作空间的问题,我们在从全状态观测控制具有22个自由度的模拟人形体以及从像素观测控制56个自由度的人形体,以及示例性的OpenAI Gym任务中展示了这一点,其中V-MPO取得了远高于此前报道的渐近分数。

关键词

引用

@article{arxiv.1909.12238,
  title  = {V-MPO: On-Policy Maximum a Posteriori Policy Optimization for Discrete and Continuous Control},
  author = {H. Francis Song and Abbas Abdolmaleki and Jost Tobias Springenberg and Aidan Clark and Hubert Soyer and Jack W. Rae and Seb Noury and Arun Ahuja and Siqi Liu and Dhruva Tirumala and Nicolas Heess and Dan Belov and Martin Riedmiller and Matthew M. Botvinick},
  journal= {arXiv preprint arXiv:1909.12238},
  year   = {2019}
}

备注

* equal contribution