中文

一种用于近端策略优化的对数障碍法

机器学习 2018-12-18 v1 机器学习

摘要

近端策略优化(PPO)已被提出作为强化学习的一阶优化方法。我们应当注意到其中使用了外罚函数法。通常,外罚函数的最小化子在惩罚参数变得越来越大时才在极限下趋于可行。因此,这可能导致采样效率低下。我们所称的带障碍法的近端策略优化(PPO-B)几乎保留了 PPO 的所有优势,如易于实现和良好的泛化性。具体而言,提出了一种带内罚函数法的新替代目标,以避免外罚函数法所产生的缺陷。可以得出结论,PPO-B 在采样效率上能够优于 PPO,因为 PPO-B 在 Atari 和 Mujoco 环境中取得了明显优于 PPO 的性能。

关键词

引用

@article{arxiv.1812.06502,
  title  = {A Logarithmic Barrier Method For Proximal Policy Optimization},
  author = {Cheng Zeng and Hongming Zhang},
  journal= {arXiv preprint arXiv:1812.06502},
  year   = {2018}
}

备注

7 pages