线性规划的 Fisher-Rao 梯度流与状态-动作自然策略梯度
最优化与控制
2025-02-05 v2 机器学习
数值分析
系统与控制
系统与控制
数值分析
机器学习
摘要
Kakade 的自然策略梯度方法近年来得到了广泛研究,显示出在有正则化和无正则化情况下的线性收敛性。我们研究了另一种基于状态-动作分布的 Fisher 信息矩阵的自然梯度方法,该方法在理论方面鲜受关注。在此,状态-动作分布在线性势的作用下,于状态-动作多面体内遵循 Fisher-Rao 梯度流。因此,我们更一般地研究了线性规划的 Fisher-Rao 梯度流,并证明了其线性收敛性,收敛速率取决于线性规划的几何性质。等价地,这给出了对线性规划由熵正则化引入误差的估计,且改进了现有结果。我们推广了这些结果,并证明了在达到近似误差之前,受扰动的 Fisher-Rao 梯度流和自然梯度流具有次线性收敛性。特别地,这些一般性结果涵盖了状态-动作自然策略梯度的情形。
引用
@article{arxiv.2403.19448,
title = {Fisher-Rao Gradient Flows of Linear Programs and State-Action Natural Policy Gradients},
author = {Johannes Müller and Semih Çaycı and Guido Montúfar},
journal= {arXiv preprint arXiv:2403.19448},
year = {2025}
}
备注
25 pages, 4 figures, to appear at SIAM Journal on Optimization