约束 MDP 自然策略梯度原始对偶方法的收敛性与样本复杂度
最优化与控制
2025-10-16 v4 人工智能
机器学习
系统与控制
系统与控制
摘要
我们研究在满足期望总效用约束的同时最大化期望总奖励的序贯决策问题。我们采用自然策略梯度方法求解约束马尔可夫决策过程(约束 MDPs)的折扣无限 horizon 最优控制问题。具体地,我们提出一种新的自然策略梯度原始对偶(NPG-PD)方法,该方法通过自然策略梯度上升更新原始变量,并通过投影次梯度下降更新对偶变量。尽管底层最大化涉及非凹目标函数和非凸约束集,在 softmax 策略参数化下,我们证明我们的方法在最优性间隙和约束违反方面均以次线性速率实现全局收敛。该收敛性与状态-动作空间的大小无关,即它是无维度的(dimension-free)。此外,对于对数线性与一般光滑策略参数化,我们建立了直至由受限策略参数化引起的函数逼近误差的次线性收敛速率。我们还为两种基于样本的 NPG-PD 算法提供了收敛性与有限样本复杂度保证。我们使用一组计算实验来展示我们方法的有效性。
引用
@article{arxiv.2206.02346,
title = {Convergence and sample complexity of natural policy gradient primal-dual methods for constrained MDPs},
author = {Dongsheng Ding and Kaiqing Zhang and Jiali Duan and Tamer Başar and Mihailo R. Jovanović},
journal= {arXiv preprint arXiv:2206.02346},
year = {2025}
}
备注
76 pages, 4 figures, 2 tables; Journal version of the NeurIPS 2020 paper; Accepted to JMLR