超越对称零和博弈的神经群体学习
人工智能
2024-01-11 v1 多智能体系统
摘要
我们研究在 n 人一般和博弈中寻找均衡的计算高效方法,特别是那些涉及复杂视觉运动技能的博弈。我们展示了现有方法在此情境下在计算或理论上的困难。随后,我们引入 NeuPL-JPSRO,一种神经群体学习算法,该算法受益于技能的迁移学习,并收敛至博弈的粗相关均衡(CCE)。我们在一系列 OpenSpiel 博弈中展示了经验收敛性,并通过精确博弈求解器进行了严格验证。接着,我们将 NeuPL-JPSRO 部署到复杂领域,在该领域中,我们的方法实现了 MuJoCo 控制域中的自适应协调以及夺旗游戏中的技能迁移。我们的工作表明,均衡收敛的群体学习可以大规模且通用地实现,为解决具有混合动机的异质玩家之间的现实世界博弈铺平了道路。
引用
@article{arxiv.2401.05133,
title = {Neural Population Learning beyond Symmetric Zero-sum Games},
author = {Siqi Liu and Luke Marris and Marc Lanctot and Georgios Piliouras and Joel Z. Leibo and Nicolas Heess},
journal= {arXiv preprint arXiv:2401.05133},
year = {2024}
}