群体博弈中 Q-learning 的动力学:一种受物理启发的连续性方程模型
多智能体系统
2022-03-04 v1
摘要
尽管学习在多智能体系统中已得到广泛应用,但其对系统时间演化的影响远未被理解。本文关注建模为群体博弈的大规模多智能体系统中 Q-learning 的动力学。我们重新审视了 Q-learning 动力学的复制子方程模型,并观察到该模型不适用于我们所关心的设定。受此启发,我们开发了一个新的形式化模型,其与物理学中的连续性方程具有形式上的联系。我们表明,我们的模型始终能准确描述不同多智能体系统初始设定与博弈配置下群体博弈中的 Q-learning 动力学。我们还表明,我们的模型可应用于不同的探索机制,描述平均动力学,并可扩展至二人及 n 人博弈中的 Q-learning。最后同样重要的是,我们表明我们的模型可对算法参数提供见解并有助于参数调优。
引用
@article{arxiv.2203.01500,
title = {The Dynamics of Q-learning in Population Games: a Physics-Inspired Continuity Equation Model},
author = {Shuyue Hu and Chin-Wing Leung and Ho-fung Leung and Harold Soh},
journal= {arXiv preprint arXiv:2203.01500},
year = {2022}
}
备注
the 21st International Conference on Autonomous Agents and Multiagent Systems(AAMAS 2022)