中文

超越对称零和博弈的神经群体学习

人工智能 2024-01-11 v1 多智能体系统

摘要

我们研究在 n 人一般和博弈中寻找均衡的计算高效方法,特别是那些涉及复杂视觉运动技能的博弈。我们展示了现有方法在此情境下在计算或理论上的困难。随后,我们引入 NeuPL-JPSRO,一种神经群体学习算法,该算法受益于技能的迁移学习,并收敛至博弈的粗相关均衡(CCE)。我们在一系列 OpenSpiel 博弈中展示了经验收敛性,并通过精确博弈求解器进行了严格验证。接着,我们将 NeuPL-JPSRO 部署到复杂领域,在该领域中,我们的方法实现了 MuJoCo 控制域中的自适应协调以及夺旗游戏中的技能迁移。我们的工作表明,均衡收敛的群体学习可以大规模且通用地实现,为解决具有混合动机的异质玩家之间的现实世界博弈铺平了道路。

关键词

引用

@article{arxiv.2401.05133,
  title  = {Neural Population Learning beyond Symmetric Zero-sum Games},
  author = {Siqi Liu and Luke Marris and Marc Lanctot and Georgios Piliouras and Joel Z. Leibo and Nicolas Heess},
  journal= {arXiv preprint arXiv:2401.05133},
  year   = {2024}
}