中文

二人马尔可夫游戏的间隙依赖界

机器学习 2021-07-05 v1 机器学习

摘要

作为强化学习领域最流行的方法之一,Q-learning 受到越来越多的关注。近来,关于不同设定下属于 Q-learning 类的算法后悔界的理论工作逐渐增多。在本文中,我们分析了在 2 人回合制随机马尔可夫游戏(2-TBSG)上执行 Nash Q-learning 算法时的累积后悔,并提出了情节式表格设定下首个间隙依赖的对数上界。该上界仅相差一个对数项即可与理论下界匹配。此外,我们将结论推广至无限 horizon 的折扣游戏设定,并提出了类似的间隙依赖对数后悔界。同时,在线性 MDP 假设下,我们在集中式与独立式两种设定中均获得了 2-TBSG 的另一种对数后悔界。

关键词

引用

@article{arxiv.2107.00685,
  title  = {Gap-Dependent Bounds for Two-Player Markov Games},
  author = {Zehao Dou and Zhuoran Yang and Zhaoran Wang and Simon S. Du},
  journal= {arXiv preprint arXiv:2107.00685},
  year   = {2021}
}

备注

34 pages