中文

Pipeline PSRO: 一种在大型博弈中寻找近似纳什均衡的可扩展方法

计算机科学与博弈论 2021-02-22 v2 人工智能 机器学习 多智能体系统

摘要

当信息状态数量庞大时,在零和不完全信息博弈中寻找近似纳什均衡十分困难。策略空间响应预言机(PSRO)是一种基于博弈论的深度强化学习算法,可保证收敛至近似纳什均衡。然而,PSRO 在每次迭代中都需要训练一个强化学习策略,使其在大型博弈中过于缓慢。我们通过反例与实验表明,DCH 与 Rectified PSRO 这两种现有的扩展 PSRO 的方法,即便在小型博弈中也无法收敛。我们提出 Pipeline PSRO (P2SRO),这是首个用于在大型零和不完全信息博弈中寻找近似纳什均衡的可扩展通用方法。P2SRO 通过维护一个分层的强化学习工作器流水线,每个工作器针对层级中较低层所生成的策略进行训练,从而能够在保证收敛的前提下并行化 PSRO。我们表明,与现有方法不同,P2SRO 可收敛至近似纳什均衡,且随着并行工作器数量的增加,在各类不完全信息博弈中收敛更快。我们还引入了一个用于 Barrage Stratego 的开源环境,这是 Stratego 的一个变体,其近似博弈树复杂度为 105010^{50}。P2SRO 能够在 Barrage Stratego 上取得最先进的性能,并击败所有现有 bot。实验代码见 https://github.com/JBLanier/pipeline-psro。

关键词

引用

@article{arxiv.2006.08555,
  title  = {Pipeline PSRO: A Scalable Approach for Finding Approximate Nash Equilibria in Large Games},
  author = {Stephen McAleer and John Lanier and Roy Fox and Pierre Baldi},
  journal= {arXiv preprint arXiv:2006.08555},
  year   = {2021}
}

备注

SM and JL contributed equally