中文

一般动作空间中熵正则化 MDP 的 actor-critic 收敛性

最优化与控制 2025-10-17 v1

摘要

我们证明了一种耦合的 actor-critic 梯度流在 Q 函数可实现性假设下,对具有线性函数逼近的连续状态与动作空间中的无限期、熵正则化马尔可夫决策过程 (MDP) 具有稳定性与全局收敛性。我们所考虑的 actor-critic 梯度流版本中,评论家 (critic) 使用时序差分 (TD) 学习进行更新,而策略 (policy) 则在独立的时间尺度上通过策略镜像下降方法进行更新。我们证明了该 actor-critic 流具有稳定性,并指数收敛至最优策略。最后,我们讨论了时间尺度分离与熵正则化之间的相互作用及其对稳定性和收敛性的影响。

关键词

引用

@article{arxiv.2510.14898,
  title  = {Convergence of actor-critic for entropy regularised MDPs in general action spaces},
  author = {Denis Zorba and David Šiška and Lukasz Szpruch},
  journal= {arXiv preprint arXiv:2510.14898},
  year   = {2025}
}

备注

23 pages