黑盒扩展式博弈中(近)最优策略的寻找与认证
计算机科学与博弈论
2021-03-18 v3
摘要
通常——例如在战争游戏、策略电子游戏和金融模拟中——博弈仅作为黑盒模拟器交给我们,我们可以在其中进行对局。在这些设定下,由于博弈可能具有未知的自然动作分布(我们只能从中获取样本)和/或规模过大而无法完全展开,计算具有可 exploitability 保证的策略可能很困难。近期工作 \cite{Zhang20:Small} 提出了扩展式博弈的一种证书概念,允许在不展开完整博弈树的情况下提供 exploitability 保证。然而,该工作假设黑盒可随时采样或展开博弈树的任意节点,且可进行一系列精确博弈求解(例如通过线性规划)来计算证书。这两个假设都严重限制了该方法的实际适用性。本工作中,我们放宽了这两项假设。我们证明,仅能通过完整体验对局、仅以 regret minimizer 作为子程序的黑盒,也可获得高概率证书。作为额外收获,我们得到了一种在扩展式博弈设定下具有 收敛率的均衡寻找算法,其不依赖具有下界可达概率的采样策略(MCCFR 所假设的)。我们通过实验证明,在黑盒设定下,我们的方法能够仅展开博弈树的一小部分就提供非平凡的 exploitability 保证。
引用
@article{arxiv.2009.07384,
title = {Finding and Certifying (Near-)Optimal Strategies in Black-Box Extensive-Form Games},
author = {Brian Hu Zhang and Tuomas Sandholm},
journal= {arXiv preprint arXiv:2009.07384},
year = {2021}
}
备注
AAAI 2021