中文

PPO-Clip 达到全局最优:对裁剪的更深入理解

机器学习 2024-02-20 v2 人工智能

摘要

采用裁剪代理目标的近端策略优化算法(PPO-Clip)是策略优化方法的一个突出范例。然而,尽管 PPO-Clip 取得了显著的经验成功,但迄今为止缺乏理论论证。在本文中,我们通过在表格和神经函数逼近设置下建立 PPO-Clip 变体的首个全局收敛结果,为该领域做出了贡献。我们的发现突出了在神经函数逼近背景下特有的 O(1/T)O(1/\sqrt{T}) 最小迭代收敛率。我们通过三个核心概念克服了分析 PPO-Clip 的固有挑战:(i) 我们引入了 PPO-Clip 目标的广义版本,并通过其与铰链损失的联系加以阐明。(ii) 采用熵镜像下降,我们建立了具有直接策略参数化的表格 PPO-Clip 的渐近收敛性。(iii) 受表格分析的启发,我们通过引入两步策略改进方法简化了收敛分析。这通过基于回归的更新方案将策略搜索与复杂的神经策略参数化解耦。此外,通过解释这些广义目标,我们对 PPO-Clip 的有效性获得了更深入的见解。我们的理论发现也标志着对裁剪机制对 PPO-Clip 收敛影响的首次刻画。重要的是,裁剪范围仅影响收敛率的预常数。

关键词

引用

@article{arxiv.2312.12065,
  title  = {PPO-Clip Attains Global Optimality: Towards Deeper Understandings of Clipping},
  author = {Nai-Chieh Huang and Ping-Chun Hsieh and Kuo-Hao Ho and I-Chen Wu},
  journal= {arXiv preprint arXiv:2312.12065},
  year   = {2024}
}