中文

面向二人零和博弈的随时PSRO

计算机科学与博弈论 2022-02-01 v2 机器学习 多智能体系统

摘要

策略空间响应预言机(PSRO)是一种多智能体强化学习算法,在非常大的二人零和博弈中取得了最先进的性能。PSRO基于表格双预言机(DO)方法,该算法保证收敛到纳什均衡,但可能从一次迭代到下一次迭代增加可利用性。我们提出随时双预言机(ADO),一种用于二人零和博弈的表格双预言机算法,保证收敛到纳什均衡的同时从一次迭代到下一次迭代降低可利用性。与DO中受限分布基于由各玩家策略集构成的受限博弈不同,ADO为每个玩家寻找在全、无限制博弈中针对任何策略最小化其可利用性的受限分布。我们还提出一种通过针对最佳响应更新的无遗憾算法来寻找该受限分布的方法,称为RM-BR DO。最后,我们提出随时PSRO(APSRO),一种通过强化学习计算最佳响应的ADO版本。在Leduc扑克和随机正规形式博弈的实验中,我们表明我们的方法相比DO和PSRO实现了低得多的可利用性,并且单调地降低可利用性。

关键词

引用

@article{arxiv.2201.07700,
  title  = {Anytime PSRO for Two-Player Zero-Sum Games},
  author = {Stephen McAleer and Kevin Wang and John Lanier and Marc Lanctot and Pierre Baldi and Tuomas Sandholm and Roy Fox},
  journal= {arXiv preprint arXiv:2201.07700},
  year   = {2022}
}

备注

Published in AAAI Reinforcement Learning in Games Workshop