中文

策略梯度方法的初等分析

最优化与控制 2024-04-12 v2 机器学习

摘要

单纯形参数化下的投影策略梯度、softmax 参数化下的策略梯度与自然策略梯度,是强化学习中的基本算法。近期有大量关于这些算法理论方面的研究。尽管如此,即使能够获得精确的策略评估,其收敛行为仍未被完全理解。本文聚焦于折扣 MDP 设定,对上述策略优化方法进行系统研究。提出了若干新结果,包括:1) 投影策略梯度在任意常数步长下的全局线性收敛;2) softmax 策略梯度在任意常数步长下的次线性收敛;3) softmax 自然策略梯度在任意常数步长下的全局线性收敛;4) 熵正则化 softmax 策略梯度在比现有结果更宽的常数步长范围内的全局线性收敛;5) 熵正则化自然策略梯度的紧致局部线性收敛速率;以及 6) 在无最优策略平稳分布假设下,软策略迭代的简洁局部二次收敛速率。为建立这些结果,本文发展了新的初等分析技术。

关键词

引用

@article{arxiv.2404.03372,
  title  = {Elementary Analysis of Policy Gradient Methods},
  author = {Jiacai Liu and Wenye Li and Ke Wei},
  journal= {arXiv preprint arXiv:2404.03372},
  year   = {2024}
}