中文

神经 PPO-Clip 达到全局最优:基于铰链损失的视角

机器学习 2022-09-02 v4

摘要

策略优化是设计强化学习算法的基本原理,其中一个例子是带裁剪替代目标函数的近端策略优化算法 (PPO-Clip),因其简单性和有效性已广泛应用于深度强化学习。尽管其实证性能优越,PPO-Clip 至今未得到理论证明。在本文中,我们建立了神经函数逼近下 PPO-Clip 的首个全局收敛速率。我们指出了分析 PPO-Clip 的基本挑战,并通过两个核心思想加以解决:(i) 我们从铰链损失的视角重新解读 PPO-Clip,将策略改进与用铰链损失求解大间隔分类问题相联系,并给出了 PPO-Clip 目标的广义版本。(ii) 基于上述观点,我们提出了一种两步策略改进方案,借助熵镜像下降和基于回归的策略更新方案,将策略搜索与复杂的神经策略参数化解耦,从而便于收敛性分析。此外,我们的理论结果首次刻画了裁剪机制对 PPO-Clip 收敛性的影响。通过实验,我们在多种 RL 基准任务上用各类分类器实证验证了 PPO-Clip 的重新解读及广义目标。

关键词

引用

@article{arxiv.2110.13799,
  title  = {Neural PPO-Clip Attains Global Optimality: A Hinge Loss Perspective},
  author = {Nai-Chieh Huang and Ping-Chun Hsieh and Kuo-Hao Ho and Hsuan-Yu Yao and Kai-Chun Hu and Liang-Chun Ouyang and I-Chen Wu},
  journal= {arXiv preprint arXiv:2110.13799},
  year   = {2022}
}

备注

33 pages, 1 figure