具有熵正则化的自然策略梯度方法的快速全局收敛
机器学习
2022-09-13 v5 信息论
机器学习
math.IT
最优化与控制
摘要
自然策略梯度(NPG)方法是当代强化学习中最广泛使用的策略优化算法之一。这类方法常与熵正则化——一种鼓励探索的算法机制——结合使用,并且与软策略迭代和信赖域策略优化密切相关。尽管取得了经验上的成功,即便在表格设置下,NPG 方法的理论基础仍十分有限。本文针对 softmax 参数化下的熵正则化 NPG 方法,发展了 收敛保证,聚焦于折扣马尔可夫决策过程(MDP)。假设可精确进行策略评估,我们证明了当计算正则化 MDP 的最优值函数时,该算法线性收敛——一旦进入最优策略附近的局部区域甚至二次收敛;此外,该算法对于策略评估的不精确性具有可证明的稳定性。我们的收敛结果适用于广泛的学习率范围,并阐明了熵正则化在促成快速收敛中的作用。
引用
@article{arxiv.2007.06558,
title = {Fast Global Convergence of Natural Policy Gradient Methods with Entropy Regularization},
author = {Shicong Cen and Chen Cheng and Yuxin Chen and Yuting Wei and Yuejie Chi},
journal= {arXiv preprint arXiv:2007.06558},
year = {2022}
}
备注
v2 adds new proofs and improved results; accepted to Operations Research