中文

超越近端策略优化的边界

机器学习 2024-11-04 v1 人工智能

摘要

近端策略优化(PPO)是一种广泛使用的在策略强化学习算法。本工作提供了一种 PPO 的替代视角,将其分解为更新向量的内循环估计,以及使用单位学习率进行梯度上升的外循环更新应用。利用这一洞察,我们提出了外层近端策略优化(outer-PPO);一个框架,其中这些更新向量使用任意的基于梯度的优化器来应用。由 outer-PPO 实现的更新估计与更新应用的解耦揭示了 PPO 中的若干隐含设计选择,我们通过实证研究对其进行了挑战。特别是,我们考虑了外循环中的非单位学习率和动量,以及内估计循环中的动量偏置。在 Brax、Jumanji 和 MinAtar 环境上,方法与经过激进调优的 PPO 基线进行了评估;在相同超参数调优预算下,非单位学习率和动量在 Brax 和 Jumanji 上均取得了统计显著的改进。

关键词

引用

@article{arxiv.2411.00666,
  title  = {Beyond the Boundaries of Proximal Policy Optimization},
  author = {Charlie B. Tan and Edan Toledo and Benjamin Ellis and Jakob N. Foerster and Ferenc Huszár},
  journal= {arXiv preprint arXiv:2411.00666},
  year   = {2024}
}