中文

一种具有均匀 PAC 保证的约束 MDP 策略梯度原始-对偶算法

机器学习 2024-07-02 v3

摘要

我们研究了一种用于在线约束马尔可夫决策过程(CMDP)的原始-对偶(PD)强化学习(RL)算法。尽管该算法在实际中广泛应用,但关于此问题的 PD-RL 算法的现有理论文献仅提供了次线性遗憾保证,且未能确保收敛到最优策略。在本文中,我们引入了一种新颖的策略梯度 PD 算法,该算法具有均匀概率近似正确性(Uniform-PAC)保证,能同时确保收敛到最优策略、次线性遗憾以及对于任何目标精度的多项式样本复杂度。值得注意的是,这是首个用于在线 CMDP 问题的 Uniform-PAC 算法。除了理论保证外,我们还在一个简单的 CMDP 中通过实验证明,我们的算法收敛到最优策略,而基线算法则表现出振荡性能和约束违反。

关键词

引用

@article{arxiv.2401.17780,
  title  = {A Policy Gradient Primal-Dual Algorithm for Constrained MDPs with Uniform PAC Guarantees},
  author = {Toshinori Kitamura and Tadashi Kozuno and Masahiro Kato and Yuki Ichihara and Soichiro Nishimori and Akiyoshi Sannai and Sho Sonoda and Wataru Kumagai and Yutaka Matsuo},
  journal= {arXiv preprint arXiv:2401.17780},
  year   = {2024}
}