中文

约束 MDP 中最后迭代收敛的策略梯度原始对偶方法

最优化与控制 2024-01-18 v2 机器学习 系统与控制 系统与控制

摘要

我们研究计算无限 horizon 折扣约束马尔可夫决策过程(constrained MDP)最优策略的问题。尽管 Lagrangian 基策略搜索方法在实践中广受欢迎,这些方法中策略迭代的振荡尚未被充分理解,带来了约束违反和对超参数敏感等问题。为填补此空白,我们采用 Lagrangian 方法将约束 MDP 转化为一个约束鞍点问题,其中 max/min 参与者分别对应原始/对偶变量,并开发了两种单时间尺度基于策略的原始对偶算法,其策略迭代以非渐近方式收敛到最优约束策略。具体而言,我们首先提出正则化策略梯度原始对偶(RPG-PD)方法,该方法使用熵正则化策略梯度更新策略,并同时通过二次正则化梯度上升更新对偶变量。我们证明 RPG-PD 的策略原始对偶迭代以次线性速率收敛到正则化鞍点,而策略迭代以次线性速率收敛到最优约束策略。我们进一步通过在策略参数化中引入函数逼近,将 RPG-PD 实例化于大状态或动作空间,并建立了类似的次线性最后迭代策略收敛。其次,我们提出乐观策略梯度原始对偶(OPG-PD)方法,其采用乐观梯度法同时更新原始/对偶变量。我们证明 OPG-PD 的策略原始对偶迭代以线性速率收敛到包含最优约束策略的鞍点。据我们所知,本工作是约束 MDP 中单时间尺度算法首个非渐近策略最后迭代收敛结果。

关键词

引用

@article{arxiv.2306.11700,
  title  = {Last-Iterate Convergent Policy Gradient Primal-Dual Methods for Constrained MDPs},
  author = {Dongsheng Ding and Chen-Yu Wei and Kaiqing Zhang and Alejandro Ribeiro},
  journal= {arXiv preprint arXiv:2306.11700},
  year   = {2024}
}

备注

65 pages, 17 figures, and 1 table; NeurIPS 2023