面向凹约束马尔可夫决策过程的基于策略的原始对偶方差缩减方法
机器学习
2024-05-28 v4 最优化与控制
摘要
我们研究凹约束马尔可夫决策过程(Concave CMDPs),其中目标函数与约束均定义为状态-动作占据测度的凹函数。我们提出方差缩减原始对偶策略梯度算法(VR-PDPG),该算法通过策略梯度上升更新原始变量,并通过投影次梯度下降更新对偶变量。尽管存在可加性结构丧失以及问题非凹性带来的挑战,我们利用一种隐式凹性证明了 VR-PDPG 的全局收敛性。在精确设定下,我们证明了平均最优性间隙与约束违反的收敛速率为 ,在目标函数关于占据测度强凹时进一步改善至 。在基于样本的设定下,我们证明 VR-PDPG 达到 -全局最优性所需的样本复杂度为 。此外,通过将递减的悲观项纳入约束,我们表明 VR-PDPG 能够在不损害最优性间隙收敛速率的前提下实现零约束违反。最后,我们通过数值实验验证了方法的有效性。
引用
@article{arxiv.2205.10715,
title = {Policy-based Primal-Dual Methods for Concave CMDP with Variance Reduction},
author = {Donghao Ying and Mengzi Amy Guo and Hyunin Lee and Yuhao Ding and Javad Lavaei and Zuo-Jun Max Shen},
journal= {arXiv preprint arXiv:2205.10715},
year = {2024}
}