两人两动作博弈中玻尔兹曼Q学习的动力学
计算机科学与博弈论
2013-07-18 v3 机器学习
多智能体系统
适应与自组织系统
种群与进化
摘要
我们考虑了在具有玻尔兹曼探索机制的两人两动作博弈中Q学习的动力学。对于任何非零探索率,动力学是耗散的,这保证了智能体策略收敛到通常不同于博弈纳什均衡的静止点。我们全面刻画了不同博弈中静止点结构的特征,并考察了该结构对探索引入噪声的敏感性。我们的结果表明,对于一类具有多个纳什均衡的博弈,学习动力学的渐近行为在临界探索率处可能发生剧烈变化。此外,我们证明,对于某些具有单一纳什均衡的博弈,可能存在额外的静止点(不对应任何纳什均衡),这些静止点在探索率的有限范围内持续存在,并在两个玩家的探索率都趋于零时消失。
引用
@article{arxiv.1109.1528,
title = {Dynamics of Boltzmann Q-Learning in Two-Player Two-Action Games},
author = {Ardeshir Kianercy and Aram Galstyan},
journal= {arXiv preprint arXiv:1109.1528},
year = {2013}
}
备注
10 pages, 12 figures. Version 2: added more extensive discussion of asymmetric equilibria; clarified conditions for continuous/discontinuous bifurcations in coordination/anti-coordination games