中文

近端策略优化中的衰减裁剪范围

机器学习 2021-07-02 v3 人工智能 机器人学

摘要

近端策略优化(PPO)是强化学习中使用最广泛的算法之一,在许多具有挑战性的问题上达到了最先进的性能。其成功的关键在于通过裁剪机制实现可靠的策略更新以及多轮小批量更新。本研究旨在为前者提供新颖、简单但有效的替代方案。为此,我们提出了在整个训练过程中线性与指数衰减的裁剪范围方法。借此,我们希望在学习阶段初期提供更高的探索性,而在末期提供更强的约束。我们在多个经典控制与运动型机器人环境中考察了它们的性能。在分析过程中,我们发现它们影响了所达成的奖励,并且在许多强化学习任务中是恒定裁剪方法的有效替代方案。

关键词

引用

@article{arxiv.2102.10456,
  title  = {Decaying Clipping Range in Proximal Policy Optimization},
  author = {Mónika Farsang and Luca Szegletes},
  journal= {arXiv preprint arXiv:2102.10456},
  year   = {2021}
}