通过原始对偶策略梯度算法学习无限期平均奖励约束 MDP 的一般参数化策略
机器学习
2024-10-31 v3 人工智能
摘要
本文探索了无限期平均奖励约束马尔可夫决策过程(CMDPs)的领域。据我们所知,这是首次深入研究具有一般策略参数化的平均奖励 CMDPs 的遗憾和约束违反分析。为了应对这一挑战,我们提出了一种基于原始对偶的策略梯度算法,该算法巧妙地管理约束,同时确保在实现全局最优策略方面具有低遗憾保证。特别地,我们提出的算法实现了 的目标遗憾和 的约束违反界限。
引用
@article{arxiv.2402.02042,
title = {Learning General Parameterized Policies for Infinite Horizon Average Reward Constrained MDPs via Primal-Dual Policy Gradient Algorithm},
author = {Qinbo Bai and Washim Uddin Mondal and Vaneet Aggarwal},
journal= {arXiv preprint arXiv:2402.02042},
year = {2024}
}