中文

通过保守自然策略梯度原始对偶算法实现约束强化学习的零约束违反

机器学习 2024-05-20 v2 人工智能 系统与控制 系统与控制

摘要

我们考虑连续状态-动作空间中的约束马尔可夫决策过程(CMDP)问题,其目标是在某些约束下最大化期望累积奖励。我们提出了一种新颖的保守自然策略梯度原始对偶算法(C-NPG-PD),以在实现目标值函数最先进收敛结果的同时达到零约束违反。对于一般策略参数化,我们证明了值函数收敛到全局最优,误差不超过受限策略类引起的近似误差。我们甚至将现有约束NPG-PD算法\cite{Ding2020}的样本复杂度从O(1/ϵ6)\mathcal{O}(1/\epsilon^6)提升到O(1/ϵ4)\mathcal{O}(1/\epsilon^4)。据我们所知,这是首个针对无限 horizon 折扣CMDP用自然策略梯度风格算法建立零约束违反的工作。我们通过实验评估展示了所提算法的优点。

关键词

引用

@article{arxiv.2206.05850,
  title  = {Achieving Zero Constraint Violation for Constrained Reinforcement Learning via Conservative Natural Policy Gradient Primal-Dual Algorithm},
  author = {Qinbo Bai and Amrit Singh Bedi and Vaneet Aggarwal},
  journal= {arXiv preprint arXiv:2206.05850},
  year   = {2024}
}

备注

The latest version fixed the error in the proof of Lemma 4 in AAAI2023