中文

重复囚徒困境中具有动态抱负水平的强化学习模型的数值分析

种群与进化 2011-04-05 v2

摘要

人类和其他动物能够根据环境线索(包括通过经验获得的反馈)调整其社会行为。然而,在社会困境博弈中,玩家基于经验的学习对合作演化与维持的影响仍相对不清楚。一些先前文献表明,学习玩家的相互合作是困难的,或者需要一个复杂的模型。在重复囚徒困境的背景下,我们数值检验了一个强化学习模型的性能。我们的模型修改了Karandikar等人(1998)、Posch等人(1999)以及Macy和Flache (2002)的模型,其中如果获得的收益大于一个动态阈值,玩家就会满足。我们表明,如果阈值动态不太快,且强化信号与下一轮行动之间的关联足够强,那么遵循修改后学习的玩家以高概率相互合作。这些学习玩家在面对反应策略时也表现高效。在演化动力学中,它们能够入侵采用更简单但具竞争力策略的玩家群体。我们的强化学习模型版本并未使先前模型复杂化,且足够简单又灵活。它可能有助于探索社会困境情境中学习与演化之间的关系。

关键词

引用

@article{arxiv.1012.0121,
  title  = {Numerical analysis of a reinforcement learning model with the dynamic aspiration level in the iterated Prisoner's Dilemma},
  author = {Naoki Masuda and Mitsuhiro Nakamura},
  journal= {arXiv preprint arXiv:1012.0121},
  year   = {2011}
}

备注

7 figures