中文

深度保守策略迭代

机器学习 2020-01-07 v2 机器学习

摘要

保守策略迭代(CPI)是近似动态规划(ADP)的奠基性算法。其核心原理是通过连续策略的随机混合来稳定贪婪性。它具有强有力的理论保证,并启发了深度强化学习(RL)中的方法。然而,CPI 本身鲜有实现,从未与神经网络结合,且仅在玩具问题上做过实验。本文展示了如何将 CPI 与具有离散动作的深度 RL 实际结合。我们还引入了受理论启发的自适应混合率。我们在简单的 Cartpole 问题上对该算法进行了充分实验,并在具有代表性的 Atari 游戏子集上验证了所提方法。总体而言,本工作表明重访经典 ADP 可能带来改进且更稳定的深度 RL 算法。

关键词

引用

@article{arxiv.1906.09784,
  title  = {Deep Conservative Policy Iteration},
  author = {Nino Vieillard and Olivier Pietquin and Matthieu Geist},
  journal= {arXiv preprint arXiv:1906.09784},
  year   = {2020}
}

备注

AAAI 2020 (long version)