重访受限策略类的策略梯度方法:通过 $k$-步策略梯度逃离仔眠局部最优解
机器学习
2026-05-12 v1 机器学习
摘要
本工作重访用于受限策略类的标准策略梯度方法,这些方法已知会陷入次优临界点。我们识别出导致这一现象的重要原因在于,策略梯度本身是仔眠的,即它仅基于单步 函数来改进策略。本文提出了一种通用的 -步策略梯度方法,通过耦合 步时间窗口内的随机性,能够在受限策略类的 MDP 中逃离仔眠局部最优解。我们证明,这种新方法在理论上保证收敛到一个在 的意义上指数接近于最优确定性策略的解。进一步地,我们表明,对该 -步策略梯度进行的投影梯度下降和镜像梯度下降可在 的迭代次数内实现此指数保证,尽管仅假设价值函数的光滑性和可微性。这将为解决此前难以实现的应用提供近似最优解,包括状态聚合和部分可观测的合作多智能体环境。此外,我们的界限避免了普遍存在的分布不匹配因子 和 ,使 -步策略梯度方法能够逃离源于探索不足而在完全可观测环境中出现的次优临界点。
引用
@article{arxiv.2605.10909,
title = {Revisiting Policy Gradients for Restricted Policy Classes: Escaping Myopic Local Optima with $k$-step Policy Gradients},
author = {Alex DeWeese and Guannan Qu},
journal= {arXiv preprint arXiv:2605.10909},
year = {2026}
}