中文

具有熵正则化的自然策略梯度方法的快速全局收敛

机器学习 2022-09-13 v5 信息论 机器学习 math.IT 最优化与控制

摘要

自然策略梯度(NPG)方法是当代强化学习中最广泛使用的策略优化算法之一。这类方法常与熵正则化——一种鼓励探索的算法机制——结合使用,并且与软策略迭代和信赖域策略优化密切相关。尽管取得了经验上的成功,即便在表格设置下,NPG 方法的理论基础仍十分有限。本文针对 softmax 参数化下的熵正则化 NPG 方法,发展了 非渐近\textit{非渐近} 收敛保证,聚焦于折扣马尔可夫决策过程(MDP)。假设可精确进行策略评估,我们证明了当计算正则化 MDP 的最优值函数时,该算法线性收敛——一旦进入最优策略附近的局部区域甚至二次收敛;此外,该算法对于策略评估的不精确性具有可证明的稳定性。我们的收敛结果适用于广泛的学习率范围,并阐明了熵正则化在促成快速收敛中的作用。

关键词

引用

@article{arxiv.2007.06558,
  title  = {Fast Global Convergence of Natural Policy Gradient Methods with Entropy Regularization},
  author = {Shicong Cen and Chen Cheng and Yuxin Chen and Yuting Wei and Yuejie Chi},
  journal= {arXiv preprint arXiv:2007.06558},
  year   = {2022}
}

备注

v2 adds new proofs and improved results; accepted to Operations Research