中文

无限时域平均奖励马尔可夫决策过程策略梯度算法的后悔分析

机器学习 2024-02-06 v3 人工智能

摘要

在本文中,我们考虑无限时域平均奖励马尔可夫决策过程(MDP)。与现有相关工作的不同之处在于,我们的方法利用了通用基于策略梯度的算法,使其摆脱了对线性 MDP 结构假设的约束。我们提出了一种基于策略梯度的算法,并展示了其全局收敛性质。随后我们证明所提算法具有 O~(T3/4)\tilde{\mathcal{O}}({T}^{3/4}) 的后悔界。值得注意的是,本文通过首次在平均奖励场景下对通用参数化策略梯度算法进行后悔界计算,标志着一项开创性努力。

关键词

引用

@article{arxiv.2309.01922,
  title  = {Regret Analysis of Policy Gradient Algorithm for Infinite Horizon Average Reward Markov Decision Processes},
  author = {Qinbo Bai and Washim Uddin Mondal and Vaneet Aggarwal},
  journal= {arXiv preprint arXiv:2309.01922},
  year   = {2024}
}