中文

不完美学习中的合作与背叛循环

物理与社会 2012-04-20 v1 社会与信息网络 适应与自组织系统

摘要

当人们进行重复博弈时,他们通常会根据过去的观察来预测对手的行动,然后决定下一步采取什么行动。行为经济学研究在这些适应性学习过程中战略决策的机制。我们在此研究一个学习迭代囚徒困境博弈的模型。玩家可以在三种策略中选择:总是背叛(ALLD)、总是合作(ALLC)和以牙还牙(TFT)。在这种情况下,唯一的严格纳什均衡是ALLD。当玩家学习进行此博弈时,收敛到均衡并不保证,例如,如果玩家对遥远过去的观察进行折扣,我们会发现合作行为。当智能体使用小样本的观察动作来估计对手的策略时,学习过程是随机的,并且合作与背叛之间会出现持续的振荡。这些循环类似于随机进化过程中发现的循环,但维持振荡的噪声来源不同,它源于对手策略的不完美采样。基于系统展开技术,我们能够预测这些学习循环的性质,为描述更一般随机适应过程的结果提供了一种分析工具。

关键词

引用

@article{arxiv.1101.4378,
  title  = {Cycles of cooperation and defection in imperfect learning},
  author = {Tobias Galla},
  journal= {arXiv preprint arXiv:1101.4378},
  year   = {2012}
}

备注

18 pages, 11 figures