关于多玩家网络博弈中学习稳定性的研究
计算机科学与博弈论
2024-03-26 v1
摘要
已有研究表明,多智能体学习算法在多种博弈中表现出复杂且不稳定的行为。事实上,先前的工作指出,随着智能体总数的增加,收敛行为发生的可能性反而降低。这似乎阻碍了在多玩家博弈中向纳什均衡等稳定策略的收敛。为应对这一挑战,我们研究了 Q 学习动力学——一种用于多智能体学习中探索与利用的经典模型。具体而言,我们研究了在网络约束智能体间交互的博弈中 Q 学习的行为。我们确定了若干依赖于博弈与网络结构的充分条件,这些条件保证智能体策略收敛到唯一稳定策略,即量子响应均衡(QRE)。关键在于,这些充分条件独立于智能体总数,从而可在任意大规模的博弈中保证可证明的收敛性。接下来,我们将学习得到的 QRE 与博弈的底层纳什均衡进行比较,证明任何 QRE 都是 -近似纳什均衡。我们首先给出 的紧界,并展示这些界如何自然地引出一种用于选择探索率的集中式方案,从而使独立学习者能够学习到稳定的近似纳什均衡策略。我们通过实验验证了该方法,并证明即使在智能体与动作数量众多的情况下,该方法依然有效。综合上述结果,我们表明即使在大量智能体存在的情况下,独立学习动力学仍可能收敛到近似纳什均衡。
引用
@article{arxiv.2403.15848,
title = {On the Stability of Learning in Network Games with Many Players},
author = {Aamal Hussain and Dan Leonte and Francesco Belardinelli and Georgios Piliouras},
journal= {arXiv preprint arXiv:2403.15848},
year = {2024}
}
备注
AAMAS 2024. arXiv admin note: text overlap with arXiv:2307.13922