中文

PPO 中可能无需比率裁剪

机器学习 2022-02-02 v1 人工智能

摘要

近端策略优化(PPO)方法通过迭代地对一个替代目标使用一组采样数据执行多个小批量优化轮次来学习策略。比率裁剪 PPO 是一种流行变体,它将目标策略与用于收集样本的策略之间的概率比率进行裁剪。比率裁剪对原始替代目标给出悲观估计,并已被证明对强劲性能至关重要。我们在本文中表明,这种比率裁剪可能并非好的选择,因为它无法有效约束比率。相反,可以直接对原始替代目标优化多轮;关键在于找到适当条件以在每次迭代中早停优化轮次。我们的理论分析阐明了如何确定何时停止优化轮次,并将所得算法称为早停策略优化(ESPO)。我们在许多连续控制任务上将 ESPO 与 PPO 进行比较,并显示 ESPO 显著优于 PPO。此外,我们表明 ESPO 可轻松扩展到具有多个工作节点的分布式训练,同样提供强劲性能。

关键词

引用

@article{arxiv.2202.00079,
  title  = {You May Not Need Ratio Clipping in PPO},
  author = {Mingfei Sun and Vitaly Kurin and Guoqing Liu and Sam Devlin and Tao Qin and Katja Hofmann and Shimon Whiteson},
  journal= {arXiv preprint arXiv:2202.00079},
  year   = {2022}
}