中文

两人两动作博弈中玻尔兹曼Q学习的动力学

计算机科学与博弈论 2013-07-18 v3 机器学习 多智能体系统 适应与自组织系统 种群与进化

摘要

我们考虑了在具有玻尔兹曼探索机制的两人两动作博弈中Q学习的动力学。对于任何非零探索率,动力学是耗散的,这保证了智能体策略收敛到通常不同于博弈纳什均衡的静止点。我们全面刻画了不同博弈中静止点结构的特征,并考察了该结构对探索引入噪声的敏感性。我们的结果表明,对于一类具有多个纳什均衡的博弈,学习动力学的渐近行为在临界探索率处可能发生剧烈变化。此外,我们证明,对于某些具有单一纳什均衡的博弈,可能存在额外的静止点(不对应任何纳什均衡),这些静止点在探索率的有限范围内持续存在,并在两个玩家的探索率都趋于零时消失。

关键词

引用

@article{arxiv.1109.1528,
  title  = {Dynamics of Boltzmann Q-Learning in Two-Player Two-Action Games},
  author = {Ardeshir Kianercy and Aram Galstyan},
  journal= {arXiv preprint arXiv:1109.1528},
  year   = {2013}
}

备注

10 pages, 12 figures. Version 2: added more extensive discussion of asymmetric equilibria; clarified conditions for continuous/discontinuous bifurcations in coordination/anti-coordination games