虚拟交叉博弈:在混合合作-竞争博弈中学习全局纳什均衡
人工智能
2023-10-06 v1 机器学习
多智能体系统
摘要
自我博弈(SP)是一种流行的多智能体强化学习(MARL)框架,用于求解竞争博弈,其中每个智能体通过将其他智能体视为环境的一部分来优化策略。尽管在经验上取得了成功,但基于SP的方法的理论性质仅限于两人零和博弈。然而,对于同一队伍中的智能体需要相互合作的混合合作-竞争博弈,我们可以给出一个简单的反例,表明基于SP的方法无法以高概率收敛到全局纳什均衡(NE)。另一方面,策略空间响应预言机(PSRO)是一种用于学习NE的迭代框架,其中每一轮迭代都学习相对于先前策略的最佳响应。PSRO可以通过联合学习队伍最佳响应直接扩展到混合合作-竞争设定,且所有收敛性质保持不变。然而,PSRO需要反复从头训练联合策略直至收敛,这使其难以扩展到复杂博弈。在本工作中,我们提出了一种新算法——虚拟交叉博弈(FXP),它继承了两种框架的优点。FXP同时训练一个基于SP的主策略和一个最佳响应策略的反种群。主策略通过虚拟自我博弈和针对反种群的交叉博弈进行训练,而反策略则作为对主策略过去版本的最佳响应进行训练。我们在矩阵博弈中验证了我们的方法,表明FXP收敛到全局NE而SP方法失败。我们还在网格世界域中进行了实验,其中FXP取得了比基线更高的Elo评分和更低的被利用度,以及一个更具挑战性的足球游戏中,FXP以超过94%的胜率击败了SOTA模型。
引用
@article{arxiv.2310.03354,
title = {Fictitious Cross-Play: Learning Global Nash Equilibrium in Mixed Cooperative-Competitive Games},
author = {Zelai Xu and Yancheng Liang and Chao Yu and Yu Wang and Yi Wu},
journal= {arXiv preprint arXiv:2310.03354},
year = {2023}
}