中文

AWESOME:一种在自我对弈中收敛并学习针对固定对手的最佳反应的通用多智能体学习算法

计算机科学与博弈论 2009-09-29 v1 机器学习 多智能体系统

摘要

令人满意的多智能体学习算法至少应具备两个特征:一是能够学习针对固定对手的最优策略,二是在自我对弈中收敛到纳什均衡。 WoLF-IGA 算法最接近这两个特征,已在两个玩家两动作重复游戏中证明具有这两个属性——但假设对手的(混合)策略是可观测的。在本文中我们提出 AWESOME,这是第一个在所有(有限)重复游戏中 guaranteed 具备这两个属性的算法。它只要求在每一步中可以观察到其他玩家的实际行动(而非其策略)。它还学习针对最终变为固定的对手的最优策略。AWESOME(Adapt When Everybody is Stationary, Otherwise Move to Equilibrium)的基本思想是:当其他玩家的策略看起来是固定的时尝试适应他们的策略,但在其他情况下则退回到预先计算的均衡策略。用于证明 AWESOME 属性的技术与以往算法使用的技术根本不同,可能有助于分析其他多智能体学习算法。

关键词

引用

@article{arxiv.cs/0307002,
  title  = {AWESOME: A General Multiagent Learning Algorithm that Converges in Self-Play and Learns a Best Response Against Stationary Opponents},
  author = {Vincent Conitzer and Tuomas Sandholm},
  journal= {arXiv preprint arXiv:cs/0307002},
  year   = {2009}
}