中文

关于分布不匹配下基于 on-policy 的策略梯度方法分析

机器学习 2026-04-02 v2 最优化与控制

摘要

策略梯度方法是解决具有挑战性的强化学习问题的最成功方法之一。尽管存在实证成功,但许多最先进的策略梯度算法针对折扣问题偏离理论策略梯度定理,因为存在分布不匹配。本文分析了这种不匹配对策略梯度方法的影响。具体而言,我们首先指出在表格参数化情况下,由不匹配引起的偏置梯度仍然可靠地表征全局最优性。随后,我们扩展此分析至更一般的参数化,通过推导折扣 MDP 中的状态分布不匹配及其导致的梯度不匹配的显式界限,表明这些界限随折扣因子趋近于一至少以线性方式消失。基于这些界限,我们进一步为偏置策略梯度迭代建立保证,表明它们接近相对于精确梯度的近似稳态点,渐近残差取决于折扣因子。我们的发现为策略梯度方法的鲁棒性以及理论基础与实际实现之间的差距提供了洞见。

关键词

引用

@article{arxiv.2503.22244,
  title  = {Analysis of On-policy Policy Gradient Methods under the Distribution Mismatch},
  author = {Weizhen Wang and Jianping He and Xiaoming Duan},
  journal= {arXiv preprint arXiv:2503.22244},
  year   = {2026}
}