中文

高效策略空间响应预言机

计算机科学与博弈论 2022-06-02 v4 人工智能 多智能体系统

摘要

策略空间响应预言机方法(PSRO)提供了学习二人零和博弈中纳什均衡的通用方案,但存在两个缺陷:(1)由于需通过模拟对元博弈进行一致评估而导致计算低效;(2)由于每个周期都针对固定元策略寻找最优响应而导致探索低效。本文提出高效 PSRO(EPSRO),大幅提升了上述两步的效率。我们方法的核心是新引入的无限制-限制(URR)博弈上的无遗憾优化子程序。通过在每个周期求解 URR,可一次性前向传播完成当前博弈评估与最优响应计算,无需元博弈模拟。理论上,我们证明 EPSRO 的求解过程在可利用性上提供单调改进,这是现有 PSRO 方法均不具备的。此外,我们证明无遗憾优化的遗憾界为 O(Tlog[(k2+k)/2])\mathcal{O}(\sqrt{T\log{[(k^2+k)/2]}}),其中 kk 为限制策略集大小。最重要的是,EPSRO 具有可并行这一理想性质,从而允许在策略空间中进行高效探索以诱导行为多样性。我们在三类博弈上测试 EPSRO,在 Kuhn 与 Leduc 扑克博弈上相较现有 PSRO 方法保持相近可利用性的同时,报告了 50 倍墙钟时间加速与 10 倍数据效率。

关键词

引用

@article{arxiv.2202.00633,
  title  = {Efficient Policy Space Response Oracles},
  author = {Ming Zhou and Jingxiao Chen and Ying Wen and Weinan Zhang and Yaodong Yang and Yong Yu and Jun Wang},
  journal= {arXiv preprint arXiv:2202.00633},
  year   = {2022}
}

备注

improved theoretical results; fixed some typos; 22 pages, 8 figures