中文

平均场博弈中的均衡学习:引入平均场 PSRO

计算机科学与博弈论 2022-08-30 v2 多智能体系统

摘要

多智能体学习的最新进展引入了一系列围绕基于种群的训练方法 PSRO 的算法,展现出向纳什均衡、相关均衡与粗相关均衡的收敛性。值得注意的是,当智能体数量增加时,学习最优响应变得指数级困难,从而阻碍了 PSRO 训练方法。平均场博弈范式在所考虑博弈为匿名对称时为此问题提供了渐近解。遗憾的是,平均场近似引入了非线性,使 PSRO 无法直接适配。基于优化与对抗遗憾最小化,本文规避了该问题并引入平均场 PSRO——一种学习平均场博弈中纳什、粗相关与相关均衡的 PSRO 适配版本。关键在于以新定义的平均场无对抗遗憾学习器或黑盒优化替代精确分布计算步骤。我们将该方法的渐近复杂度与标准 PSRO 比较,通过压缩时间混合权重极大提升了经验_bandit 收敛速度,并确保其在理论上对收益噪声具有鲁棒性。最后,我们在多个平均场博弈上展示了平均场 PSRO 的速度与精度,证明了向强均衡与弱均衡的收敛。

关键词

引用

@article{arxiv.2111.08350,
  title  = {Learning Equilibria in Mean-Field Games: Introducing Mean-Field PSRO},
  author = {Paul Muller and Mark Rowland and Romuald Elie and Georgios Piliouras and Julien Perolat and Mathieu Lauriere and Raphael Marinier and Olivier Pietquin and Karl Tuyls},
  journal= {arXiv preprint arXiv:2111.08350},
  year   = {2022}
}

备注

AAMAS