中文

面向凹约束马尔可夫决策过程的基于策略的原始对偶方差缩减方法

机器学习 2024-05-28 v4 最优化与控制

摘要

我们研究凹约束马尔可夫决策过程(Concave CMDPs),其中目标函数与约束均定义为状态-动作占据测度的凹函数。我们提出方差缩减原始对偶策略梯度算法(VR-PDPG),该算法通过策略梯度上升更新原始变量,并通过投影次梯度下降更新对偶变量。尽管存在可加性结构丧失以及问题非凹性带来的挑战,我们利用一种隐式凹性证明了 VR-PDPG 的全局收敛性。在精确设定下,我们证明了平均最优性间隙与约束违反的收敛速率为 O(T1/3)O(T^{-1/3}),在目标函数关于占据测度强凹时进一步改善至 O(T1/2)O(T^{-1/2})。在基于样本的设定下,我们证明 VR-PDPG 达到 ϵ\epsilon-全局最优性所需的样本复杂度为 O~(ϵ4)\widetilde{O}(\epsilon^{-4})。此外,通过将递减的悲观项纳入约束,我们表明 VR-PDPG 能够在不损害最优性间隙收敛速率的前提下实现零约束违反。最后,我们通过数值实验验证了方法的有效性。

关键词

引用

@article{arxiv.2205.10715,
  title  = {Policy-based Primal-Dual Methods for Concave CMDP with Variance Reduction},
  author = {Donghao Ying and Mengzi Amy Guo and Hyunin Lee and Yuhao Ding and Javad Lavaei and Zuo-Jun Max Shen},
  journal= {arXiv preprint arXiv:2205.10715},
  year   = {2024}
}