中文

零和马尔可夫博弈中强化学习的新策略迭代算法

机器学习 2023-10-31 v4 人工智能 计算机科学与博弈论 系统与控制 系统与控制

摘要

标准 MDP 中的最优策略可通过值迭代或策略迭代获得。然而,在零和马尔可夫博弈中,尚无高效的策略迭代算法;例如,已证明要实现唯一已知的收敛版策略迭代,必须求解 Omega(1/(1-alpha)) 个 MDP,其中 alpha 为折扣因子。另一种称为朴素策略迭代的算法易于实现,但仅在非常限制性假设下被证明收敛。先前修复朴素策略迭代算法的尝试存在若干局限。本文中,我们展示博弈中朴素策略迭代的一个简单变体可指数级快速收敛。我们对该朴素策略迭代提出的唯一补充是使用前瞻策略(lookahead policies),而这在实用算法中本就会被采用。我们进一步证明,在线性马尔可夫博弈(即被广泛研究的线性 MDP 的对应物)的函数近似设定中,前瞻可被高效实现。我们通过给出基于策略的 RL(强化学习)算法的界来阐明算法的应用。我们将结果扩展到函数近似设定。

关键词

引用

@article{arxiv.2303.09716,
  title  = {A New Policy Iteration Algorithm For Reinforcement Learning in Zero-Sum Markov Games},
  author = {Anna Winnicki and R. Srikant},
  journal= {arXiv preprint arXiv:2303.09716},
  year   = {2023}
}

备注

41 pages