中文

关于回合制零和马尔可夫博弈的强化学习

机器学习 2020-02-26 v1 机器学习

摘要

我们考虑为两人回合制零和博弈寻找纳什均衡的问题。受 AlphaGo Zero (AGZ) 算法启发,我们提出了一种基于强化学习的方法。具体而言,我们提出探索-改进-监督(EIS)方法,其结合“探索”、“策略改进”与“监督学习”以寻找与纳什均衡相关的价值函数与策略。我们给出了该方法收敛性与正确性的充分条件。对于 EIS 的一个具体实例——以随机策略用于“探索”、蒙特卡洛树搜索用于“策略改进”、最近邻用于“监督学习”——我们证明当博弈底层状态空间为连续且 d 维时,该方法在 O~(ε(d+4))\widetilde{O}(\varepsilon^{-(d+4)}) 步内找到纳什均衡的 ε\varepsilon-近似价值函数。这近乎最优,因为我们建立了任意策略下 Ω~(ε(d+2))\widetilde{\Omega}(\varepsilon^{-(d+2)}) 的下界。

关键词

引用

@article{arxiv.2002.10620,
  title  = {On Reinforcement Learning for Turn-based Zero-sum Markov Games},
  author = {Devavrat Shah and Varun Somani and Qiaomin Xie and Zhi Xu},
  journal= {arXiv preprint arXiv:2002.10620},
  year   = {2020}
}