中文

神经近端/信赖域策略优化达到全局最优策略

机器学习 2023-03-01 v3 最优化与控制 机器学习

摘要

由神经网络参数化的行动者与评论者的近端策略优化与信赖域策略优化(PPO 与 TRPO)在深度强化学习中取得了显著的实证成功。然而,由于非凸性,PPO 与 TRPO 的全局收敛性仍知之甚少,这使得理论落后于实践。本文中,我们证明一种配备过参数化神经网络的 PPO 与 TRPO 变体以亚线性速率收敛到全局最优策略。我们分析的关键在于无限维镜像下降在一点单调性概念下的全局收敛,其中梯度与迭代由神经网络实例化。特别地,此类神经网络的过参数化所诱导的良好表示能力与优化几何使其能精确近似无限维梯度与迭代。

关键词

引用

@article{arxiv.1906.10306,
  title  = {Neural Proximal/Trust Region Policy Optimization Attains Globally Optimal Policy},
  author = {Boyi Liu and Qi Cai and Zhuoran Yang and Zhaoran Wang},
  journal= {arXiv preprint arXiv:1906.10306},
  year   = {2023}
}

备注

A short version