基于期望的扰动学习自动机
计算机科学与博弈论
2018-03-08 v1
摘要
本文提出了一种新颖的基于收益的学习方案,用于重复进行的策略式博弈中的分布式优化。标准的基于强化学习的方法在其渐近稳定性方面存在若干局限。例如,在两人协调博弈中,收益占优(或高效)纳什均衡可能不是随机稳定的。在本工作中,我们提出了扰动学习自动机的一种扩展,即基于期望的扰动学习自动机(APLA),以克服这些局限。我们给出了 APLA 在多玩家协调博弈中的随机稳定性分析。我们进一步表明,收益占优纳什均衡是唯一的随机稳定状态。
引用
@article{arxiv.1803.02751,
title = {Aspiration-based Perturbed Learning Automata},
author = {Georgios C. Chasparis},
journal= {arXiv preprint arXiv:1803.02751},
year = {2018}
}
备注
arXiv admin note: text overlap with arXiv:1709.05859, arXiv:1702.08334