中文

线性规划的 Fisher-Rao 梯度流与状态-动作自然策略梯度

最优化与控制 2025-02-05 v2 机器学习 数值分析 系统与控制 系统与控制 数值分析 机器学习

摘要

Kakade 的自然策略梯度方法近年来得到了广泛研究,显示出在有正则化和无正则化情况下的线性收敛性。我们研究了另一种基于状态-动作分布的 Fisher 信息矩阵的自然梯度方法,该方法在理论方面鲜受关注。在此,状态-动作分布在线性势的作用下,于状态-动作多面体内遵循 Fisher-Rao 梯度流。因此,我们更一般地研究了线性规划的 Fisher-Rao 梯度流,并证明了其线性收敛性,收敛速率取决于线性规划的几何性质。等价地,这给出了对线性规划由熵正则化引入误差的估计,且改进了现有结果。我们推广了这些结果,并证明了在达到近似误差之前,受扰动的 Fisher-Rao 梯度流和自然梯度流具有次线性收敛性。特别地,这些一般性结果涵盖了状态-动作自然策略梯度的情形。

关键词

引用

@article{arxiv.2403.19448,
  title  = {Fisher-Rao Gradient Flows of Linear Programs and State-Action Natural Policy Gradients},
  author = {Johannes Müller and Semih Çaycı and Guido Montúfar},
  journal= {arXiv preprint arXiv:2403.19448},
  year   = {2025}
}

备注

25 pages, 4 figures, to appear at SIAM Journal on Optimization