FM3Q: 面向两团队零和马尔可夫博弈的因子化多智能体极小化Q学习
人工智能
2024-02-02 v1
摘要
许多实际应用涉及分属两个团队的智能体,其收益在同一团队内相等,但与对手团队符号相反。所谓的两团队零和马尔可夫博弈(2t0sMGs)近年来可以通过强化学习解决。然而,现有方法由于未充分考虑团队内信用分配、数据利用和计算难处理性而效率低下。本文提出了个体-全局-极小化(IGMM)原则,以确保2t0sMGs中两团队极小化行为与个体贪婪行为通过Q函数的一致性。基于此,我们提出了一种新颖的多智能体强化学习框架——因子化多智能体极小化Q学习(FM3Q),该框架可以将联合极小化Q函数分解为个体Q函数,并迭代求解满足IGMM的2t0sMGs极小化Q函数。此外,我们提出了一种基于神经网络的在线学习算法来实现FM3Q,并为两团队玩家获得确定性和去中心化的极小化策略。提供了理论分析证明FM3Q的收敛性。在实验中,我们使用三个环境评估FM3Q的学习效率和最终性能,并展示了其在2t0sMGs上的优越性。
引用
@article{arxiv.2402.00738,
title = {FM3Q: Factorized Multi-Agent MiniMax Q-Learning for Two-Team Zero-Sum Markov Game},
author = {Guangzheng Hu and Yuanheng Zhu and Haoran Li and Dongbin Zhao},
journal= {arXiv preprint arXiv:2402.00738},
year = {2024}
}