中文

弥合牛顿-拉夫森方法与正则化策略迭代之间的鸿沟

机器学习 2023-10-12 v1

摘要

正则化是强化学习算法中最重要的技术之一。著名的 soft actor-critic 算法是正则化策略迭代的一个特例,其中正则化项选为香农熵。尽管正则化策略迭代取得了一些经验性成功,其理论根基仍不清晰。本文证明了在利用强凸函数平滑贝尔曼方程的条件下,正则化策略迭代与标准牛顿-拉夫森方法严格等价。这一等价性为统一分析正则化策略迭代的全局与局部收敛行为奠定了基础。我们证明了正则化策略迭代具有全局线性收敛性,收敛速率为 γ\gamma(折扣因子)。此外,一旦该算法进入最优值附近的局部区域,便以二次速度收敛。我们还表明,正则化策略迭代的一个修正版本(即带有有限步策略评估)等价于非精确牛顿法,其中牛顿迭代公式通过截断迭代求解。我们证明了相关算法达到渐近线性收敛速率 γM\gamma^M,其中 MM 表示策略评估中执行的步数。我们的结果朝着更好地理解正则化策略迭代算法的收敛性质迈出了坚实的一步。

关键词

引用

@article{arxiv.2310.07211,
  title  = {Bridging the Gap between Newton-Raphson Method and Regularized Policy Iteration},
  author = {Zeyang Li and Chuxiong Hu and Yunan Wang and Guojian Zhan and Jie Li and Shengbo Eben Li},
  journal= {arXiv preprint arXiv:2310.07211},
  year   = {2023}
}