中文

一种用于二人零和随机博弈的广义极小极大Q-learning算法

机器学习 2022-03-21 v7 计算机科学与博弈论 机器学习

摘要

我们考虑二人零和博弈问题。该问题在文献中被建模为极小极大Markov博弈。该博弈的解,即从给定状态出发的极小极大收益,称为该状态的极小极大值。在本工作中,我们利用 successive relaxation(逐次松弛)技术计算二人零和博弈的解,该技术在文献中已成功应用于Markov决策过程以得到更快的值迭代算法。我们将逐次松弛的概念推广到二人零和博弈的设定中。我们证明,在博弈具有特殊结构时,该技术可加速状态极小极大值的计算。随后我们推导出一种广义极小极大Q-learning算法,可在模型信息未知时计算最优策略。最后,在迭代有界的假设下,我们利用随机逼近技术证明了所提广义极小极大Q-learning算法的收敛性。通过实验,我们展示了所提算法的有效性。

关键词

引用

@article{arxiv.1906.06659,
  title  = {A Generalized Minimax Q-learning Algorithm for Two-Player Zero-Sum Stochastic Games},
  author = {Raghuram Bharadwaj Diddigi and Chandramouli Kamanchi and Shalabh Bhatnagar},
  journal= {arXiv preprint arXiv:1906.06659},
  year   = {2022}
}