中文

P3O:策略上-策略下策略优化

机器学习 2019-07-17 v2 机器学习

摘要

同策略(on-policy)强化学习(RL)算法样本复杂度高,而离策略(off-policy)算法难以调参。将二者结合有望开发出在多样环境中泛化的高效算法。然而在实践中,找到控制该权衡的合适超参数具有挑战性。本文提出一种名为P3O的简单算法,其将离策略更新与同策略更新交错进行。P3O利用行为策略与目标策略之间的有效样本量来控制二者之间可偏离的程度,且不引入任何额外超参数。在Atari-2600和MuJoCo基准套件上的大量实验表明,这一简单技术能有效降低最先进算法的样本复杂度。复现本文实验的代码见 https://github.com/rasoolfa/P3O。

关键词

引用

@article{arxiv.1905.01756,
  title  = {P3O: Policy-on Policy-off Policy Optimization},
  author = {Rasool Fakoor and Pratik Chaudhari and Alexander J. Smola},
  journal= {arXiv preprint arXiv:1905.01756},
  year   = {2019}
}

备注

UAI 2019 conference paper. Code: https://github.com/rasoolfa/P3O