中文

通过原始对偶策略梯度算法学习无限期平均奖励约束 MDP 的一般参数化策略

机器学习 2024-10-31 v3 人工智能

摘要

本文探索了无限期平均奖励约束马尔可夫决策过程(CMDPs)的领域。据我们所知,这是首次深入研究具有一般策略参数化的平均奖励 CMDPs 的遗憾和约束违反分析。为了应对这一挑战,我们提出了一种基于原始对偶的策略梯度算法,该算法巧妙地管理约束,同时确保在实现全局最优策略方面具有低遗憾保证。特别地,我们提出的算法实现了 O~(T4/5)\tilde{\mathcal{O}}({T}^{4/5}) 的目标遗憾和 O~(T4/5)\tilde{\mathcal{O}}({T}^{4/5}) 的约束违反界限。

关键词

引用

@article{arxiv.2402.02042,
  title  = {Learning General Parameterized Policies for Infinite Horizon Average Reward Constrained MDPs via Primal-Dual Policy Gradient Algorithm},
  author = {Qinbo Bai and Washim Uddin Mondal and Vaneet Aggarwal},
  journal= {arXiv preprint arXiv:2402.02042},
  year   = {2024}
}