中文

XDO:一种用于扩展式博弈的双重预言算法

计算机科学与博弈论 2022-02-01 v2 人工智能 机器学习 多智能体系统

摘要

Policy Space Response Oracles(PSRO,策略空间响应预言)是一种用于两人零和博弈的强化学习(RL)算法,经验表明其可在大型博弈中找到近似纳什均衡。尽管PSRO保证收敛到近似纳什均衡且能处理连续动作,但随着信息状态(infostates)数量的增长,其迭代次数可能呈指数级增加。我们提出Extensive-Form Double Oracle(XDO,扩展式双重预言),一种用于两人零和博弈的扩展式双重预言算法,保证以信息状态数量的线性复杂度收敛到近似纳什均衡。与PSRO在博弈根节点混合最佳响应不同,XDO在每个信息状态处混合最佳响应。我们还引入了Neural XDO(NXDO),其中最佳响应通过深度RL学习。在Leduc扑克的表格实验中,我们发现XDO达到近似纳什均衡所需的迭代次数比PSRO小一个数量级。在改进的Leduc扑克博弈和Oshi-Zumo上的实验表明,在相同计算量下,表格XDO比CFR具有更低的可利用度。我们还发现,在序列多维连续动作博弈中,NXDO优于PSRO和NFSP。NXDO是首个能在高维连续动作序列博弈中找到近似纳什均衡的深度RL方法。实验代码可在 https://github.com/indylab/nxdo 获取。

关键词

引用

@article{arxiv.2103.06426,
  title  = {XDO: A Double Oracle Algorithm for Extensive-Form Games},
  author = {Stephen McAleer and John Lanier and Kevin Wang and Pierre Baldi and Roy Fox},
  journal= {arXiv preprint arXiv:2103.06426},
  year   = {2022}
}

备注

35th Conference on Neural Information Processing Systems (NeurIPS 2021)