不完全信息下多智能体协作的联合策略搜索
机器学习
2020-12-08 v5 人工智能
计算机科学与博弈论
多智能体系统
机器学习
摘要
学习不完全信息下多智能体协作的良好联合策略仍是一项根本挑战。对于两人零和博弈,坐标上升方法(一次优化一个智能体的策略,例如自我博弈)在有保证的情况下可行,但在多智能体合作设定中常收敛到次优纳什均衡。另一方面,由于策略间复杂的相互作用(例如上游更新影响下游状态可达性),在不完全信息博弈中直接建模联合策略变化并非易事。本文中,我们表明博弈值的全局变化可分解为定位于每个信息集的策略变化,并引入称为策略变化密度的新术语。基于此,我们提出联合策略搜索(JPS),在不完全信息博弈中迭代改进协作智能体的联合策略,而无需重新评估整个博弈。在多智能体协作表格博弈中,JPS 被证明绝不会使性能变差,且能改进单边方法(如 CFR)给出的解,优于为协作策略学习设计的算法(如 BAD)。此外,对于真实世界博弈,JPS 具有与梯度更新自然关联的在线形式。我们将其应用于合约桥牌——一种 4 人不完全信息博弈,其中 2 人组队协作对抗另外 2 人。在叫牌阶段,玩家依次叫牌以通过有限信息通道找到好定约。基于一个仅通过领域无关自我博弈叫出有竞争力桥牌的强基线智能体,JPS 改善了队友间的协作,并在 1k 局中以每副 +0.63 IMPs(国际匹配分)优于夺冠软件 WBridge5,显著优于先前 SoTA(Double-Dummy 评估下 +0.41 IMPs/副)。
引用
@article{arxiv.2008.06495,
title = {Joint Policy Search for Multi-agent Collaboration with Imperfect Information},
author = {Yuandong Tian and Qucheng Gong and Tina Jiang},
journal= {arXiv preprint arXiv:2008.06495},
year = {2020}
}
备注
Minor fix of the algorithm block