中文

Polish 空间中熵正则化马尔可夫决策过程的 Fisher-Rao 梯度流

最优化与控制 2025-06-09 v3 机器学习 概率论

摘要

我们研究了无限时域熵正则化马尔可夫决策过程在 Polish 状态与动作空间下的 Fisher-Rao 策略梯度流的全局收敛性。该流是策略镜像下降方法的一个连续时间类比。我们建立了梯度流的全局适定性,并证明其以指数速率收敛至最优策略。此外,我们证明该流相对于梯度评估是稳定的,从而为具有对数线性策略参数化的自然策略梯度流的性能提供了见解。为克服由目标函数缺乏凸性以及由熵正则化引起的不连续性所带来的挑战,我们利用了性能差引理以及梯度流与镜像下降流之间的对偶关系。我们的分析为开发各类离散策略梯度算法提供了理论基础。

关键词

引用

@article{arxiv.2310.02951,
  title  = {A Fisher-Rao gradient flow for entropy-regularised Markov decision processes in Polish spaces},
  author = {Bekzhan Kerimkulov and James-Michael Leahy and David Siska and Lukasz Szpruch and Yufei Zhang},
  journal= {arXiv preprint arXiv:2310.02951},
  year   = {2025}
}

备注

Accepted for publication in Foundations of Computational Mathematics