平均奖励约束 MDP 的全局收敛性:基于 primal-dual Actor-Critic 算法
机器学习
2025-12-11 v2 人工智能
摘要
本文研究具有一般参数化的平均奖励约束马尔可夫决策过程(CMDP),提出一种 primal-dual Natural Actor-Critic 算法,能够有效管理约束并实现高收敛速率。具体而言,在混合时间已知的情况下,本算法在长度为 T 的时间轴上实现全局收敛,约束违规率为 。若混合时间 未知,则可达到的收敛率变为 ,前提是 。我们的结果匹配马尔可夫决策过程的理论下界,为平均奖励 CMDP 的理论探索树立了新的基准。
引用
@article{arxiv.2505.15138,
title = {Global Convergence for Average Reward Constrained MDPs with Primal-Dual Actor Critic Algorithm},
author = {Yang Xu and Swetha Ganesh and Washim Uddin Mondal and Qinbo Bai and Vaneet Aggarwal},
journal= {arXiv preprint arXiv:2505.15138},
year = {2025}
}
备注
NeurIPS 2025