中文

基于期望的扰动学习自动机

计算机科学与博弈论 2018-03-08 v1

摘要

本文提出了一种新颖的基于收益的学习方案,用于重复进行的策略式博弈中的分布式优化。标准的基于强化学习的方法在其渐近稳定性方面存在若干局限。例如,在两人协调博弈中,收益占优(或高效)纳什均衡可能不是随机稳定的。在本工作中,我们提出了扰动学习自动机的一种扩展,即基于期望的扰动学习自动机(APLA),以克服这些局限。我们给出了 APLA 在多玩家协调博弈中的随机稳定性分析。我们进一步表明,收益占优纳什均衡是唯一的随机稳定状态。

关键词

引用

@article{arxiv.1803.02751,
  title  = {Aspiration-based Perturbed Learning Automata},
  author = {Georgios C. Chasparis},
  journal= {arXiv preprint arXiv:1803.02751},
  year   = {2018}
}

备注

arXiv admin note: text overlap with arXiv:1709.05859, arXiv:1702.08334