中文

具有完美回忆的双人零和部分可观测马尔可夫博弈的无模型学习

机器学习 2021-06-14 v1 机器学习

摘要

我们研究通过自我博弈在不完美信息博弈(IIG)中学习纳什均衡(NE)的问题。具体而言,我们关注在完美回忆假设下的双人、零和、回合制、表格型 IIG,其中唯一反馈是博弈的实现(bandit 反馈)。特别地,IIG 的动态未知——我们只能通过采样或与博弈模拟器交互来访问它。针对该学习设定,我们给出隐式探索在线镜像下降(IXOMD)算法。它是一种无模型算法,对收敛到 NE 的速率具有高阶概率界,阶数为 1/T1/\sqrt{T},其中 TT 为已玩博弈的次数。此外,IXOMD 计算高效,因其只需沿采样轨迹执行更新。

关键词

引用

@article{arxiv.2106.06279,
  title  = {Model-Free Learning for Two-Player Zero-Sum Partially Observable Markov Games with Perfect Recall},
  author = {Tadashi Kozuno and Pierre Ménard and Rémi Munos and Michal Valko},
  journal= {arXiv preprint arXiv:2106.06279},
  year   = {2021}
}

备注

20 pages