中文

平均奖励约束 MDP 的全局收敛性:基于 primal-dual Actor-Critic 算法

机器学习 2025-12-11 v2 人工智能

摘要

本文研究具有一般参数化的平均奖励约束马尔可夫决策过程(CMDP),提出一种 primal-dual Natural Actor-Critic 算法,能够有效管理约束并实现高收敛速率。具体而言,在混合时间已知的情况下,本算法在长度为 T 的时间轴上实现全局收敛,约束违规率为 O~(1/T)\tilde{\mathcal{O}}(1/\sqrt{T})。若混合时间 τmix\tau_{\mathrm{mix}} 未知,则可达到的收敛率变为 O~(1/T0.5ϵ)\tilde{\mathcal{O}}(1/T^{0.5-\epsilon}),前提是 TO~(τmix2/ϵ)T \geq \tilde{\mathcal{O}}\left(\tau_{\mathrm{mix}}^{2/\epsilon}\right)。我们的结果匹配马尔可夫决策过程的理论下界,为平均奖励 CMDP 的理论探索树立了新的基准。

关键词

引用

@article{arxiv.2505.15138,
  title  = {Global Convergence for Average Reward Constrained MDPs with Primal-Dual Actor Critic Algorithm},
  author = {Yang Xu and Swetha Ganesh and Washim Uddin Mondal and Qinbo Bai and Vaneet Aggarwal},
  journal= {arXiv preprint arXiv:2505.15138},
  year   = {2025}
}

备注

NeurIPS 2025