中文

自博弈 PSRO:面向二人零和博弈中的最优策略群体

计算机科学与博弈论 2022-07-15 v1 机器学习 多智能体系统

摘要

在竞争性双智能体环境中,基于双重预言机(Double Oracle, DO)算法的深度强化学习(RL)方法,如策略空间响应预言机(Policy Space Response Oracles, PSRO)与随时 PSRO(Anytime PSRO, APSRO),迭代地将 RL 最优响应策略加入策略群体。最终,这些群体策略的最优混合将逼近纳什均衡。然而,这些方法在收敛前可能需要加入所有确定性策略。在本工作中,我们引入自博弈 PSRO(Self-Play PSRO, SP-PSRO),一种在每次迭代中向群体加入近似最优随机策略的方法。SP-PSRO 不仅向对手最不易被利用的群体混合加入确定性最优响应,还学习一个近似最优随机策略并将其也加入群体。因此,SP-PSRO 在经验上往往比 APSRO 收敛快得多,且在许多博弈中仅数次迭代即收敛。

关键词

引用

@article{arxiv.2207.06541,
  title  = {Self-Play PSRO: Toward Optimal Populations in Two-Player Zero-Sum Games},
  author = {Stephen McAleer and JB Lanier and Kevin Wang and Pierre Baldi and Roy Fox and Tuomas Sandholm},
  journal= {arXiv preprint arXiv:2207.06541},
  year   = {2022}
}