两人零和博弈的全局策略空间响应查询者
人工智能
2026-05-28 v1
摘要
策略空间响应查询者 (PSRO) 框架通过迭代扩展受限策略集来扩展大型零和博弈的均衡计算。其中一个核心挑战是在有限计算预算下构建一个小规模的策略群体,其诱导博弈能很好地近似完整博弈。现有的 PSRO 变体通常基于从受限博弈中计算的受限博弈的最佳响应来扩展群体,这可能导致效率低下的扩展,提供的改进有限。我们提议通过直接评估扩展后群体的质量来指导群体扩展。具体而言,我们采用群体可被利用性 (Population Exploitability, PE) 来衡量受限策略集能否代表完整博弈,并引入一种两阶段探索-选择框架,显式最小化 PE 以进行扩展。我们将该框架实例化为全局 PSRO,一种实用的基于深度强化学习的算法,能够高效生成候选响应并通过参数共享条件神经网络估计 PE。跨多个两人零和博弈的实验表明,全局 PSRO 在策略迭代次数上显著少于先前 PSRO 方法,实现了更低的可被利用性并更好地近似纳什均衡。
引用
@article{arxiv.2605.28273,
title = {Global Policy-Space Response Oracles for Two-Player Zero-Sum Games},
author = {Junyu Zhang and Feihong Yang and Jian Wang and Chao Wang and Xudong Zhang},
journal= {arXiv preprint arXiv:2605.28273},
year = {2026}
}
备注
Accepted by ICML 2026