协调博弈中的抱负学习
计算机科学与博弈论
2019-03-20 v1 机器学习
摘要
我们考虑了基于抱负学习的动力学在协调博弈中分布式收敛到高效结果的问题。在抱负学习下,只要获得的奖励超过指定的抱负水平,玩家就会继续执行一个动作。这里,抱负水平是过去奖励的衰减记忆平均值,并且这些水平也会受到偶尔的随机扰动。每当获得的奖励低于抱负水平时,玩家就会变得不满意,在这种情况下,玩家会以与不满意程度成比例的概率进行尝试。我们的第一个贡献是,根据一个等价的有限状态马尔可夫链,刻画了迭代过程的诱导马尔可夫链的渐近行为。然后,我们在广义版本的协调博弈中明确刻画了所提出的抱负学习的行为,其例子包括网络形成和公共池博弈。特别地,我们表明,在一般协调博弈中,高效行动组合被采用的频率可以任意大。尽管收敛到高效结果是可取的,但在某些协调博弈中,例如公共池博弈,公平结果的可得性,即玩家以相同频率体验到高回报回报的行动序列,也可能具有特殊意义。为此,我们通过分析和模拟证明,抱负学习在所有对称协调博弈(包括公共池博弈)中也建立了公平结果。
引用
@article{arxiv.1110.4412,
title = {Aspiration Learning in Coordination Games},
author = {Georgios C. Chasparis and Ari Arapostathis and Jeff S. Shamma},
journal= {arXiv preprint arXiv:1110.4412},
year = {2019}
}
备注
27 pages