中文

黑盒扩展式博弈中(近)最优策略的寻找与认证

计算机科学与博弈论 2021-03-18 v3

摘要

通常——例如在战争游戏、策略电子游戏和金融模拟中——博弈仅作为黑盒模拟器交给我们,我们可以在其中进行对局。在这些设定下,由于博弈可能具有未知的自然动作分布(我们只能从中获取样本)和/或规模过大而无法完全展开,计算具有可 exploitability 保证的策略可能很困难。近期工作 \cite{Zhang20:Small} 提出了扩展式博弈的一种证书概念,允许在不展开完整博弈树的情况下提供 exploitability 保证。然而,该工作假设黑盒可随时采样或展开博弈树的任意节点,且可进行一系列精确博弈求解(例如通过线性规划)来计算证书。这两个假设都严重限制了该方法的实际适用性。本工作中,我们放宽了这两项假设。我们证明,仅能通过完整体验对局、仅以 regret minimizer 作为子程序的黑盒,也可获得高概率证书。作为额外收获,我们得到了一种在扩展式博弈设定下具有 O~(1/T)\tilde O(1/\sqrt{T}) 收敛率的均衡寻找算法,其不依赖具有下界可达概率的采样策略(MCCFR 所假设的)。我们通过实验证明,在黑盒设定下,我们的方法能够仅展开博弈树的一小部分就提供非平凡的 exploitability 保证。

关键词

引用

@article{arxiv.2009.07384,
  title  = {Finding and Certifying (Near-)Optimal Strategies in Black-Box Extensive-Form Games},
  author = {Brian Hu Zhang and Tuomas Sandholm},
  journal= {arXiv preprint arXiv:2009.07384},
  year   = {2021}
}

备注

AAAI 2021