中文

零和不完全信息博弈中对博弈树的适应

机器学习 2023-02-16 v2 机器学习

摘要

不完全信息博弈(IIG)是指每位玩家仅能部分观测当前博弈状态的博弈。我们研究如何通过具有轨迹反馈的自我博弈,在零和 IIG 中学习 ϵ\epsilon-最优策略。我们给出了以高概率学习这些策略所需实现次数的与问题无关的下界 O~(H(AX+BY)/ϵ2)\widetilde{\mathcal{O}}(H(A_{\mathcal{X}}+B_{\mathcal{Y}})/\epsilon^2),其中 HH 为博弈长度,AXA_{\mathcal{X}}BYB_{\mathcal{Y}} 为两名玩家的总动作数。我们还针对该设定提出了两种 Follow the Regularized Leader(FTRL,正则化跟随领导者)算法:Balanced FTRL 达到了该下界,但需事先知晓信息集结构以定义正则化项;Adaptive FTRL 无需此前提,通过逐步使正则化项适应观测,所需实现次数为 O~(H2(AX+BY)/ϵ2)\widetilde{\mathcal{O}}(H^2(A_{\mathcal{X}}+B_{\mathcal{Y}})/\epsilon^2)

关键词

引用

@article{arxiv.2212.12567,
  title  = {Adapting to game trees in zero-sum imperfect information games},
  author = {Côme Fiegel and Pierre Ménard and Tadashi Kozuno and Rémi Munos and Vianney Perchet and Michal Valko},
  journal= {arXiv preprint arXiv:2212.12567},
  year   = {2023}
}