中文

从长期重复囚徒困境实验观察中推断策略

计算机科学与博弈论 2024-03-12 v1

摘要

尽管许多理论研究已揭示在重复囚徒困境中能够促成并维持合作的策略,但对于人类参与者在此博弈中实际采取的行为,以及当每轮面对匿名搭档时策略如何变化,我们知之甚少。以往的尝试多采用短期实验,对可能策略做了不同假设,并得出了迥异的结论。本文给出两种长期实验处理,其区别在于所使用的搭档匹配策略,即固定搭档或打乱搭档。我们在此使用无监督方法根据参与者的行动对其进行聚类,随后利用隐马尔可夫模型推断各聚类中的策略。对推断策略的分析表明,固定搭档交互会导致行为自组织。打乱搭档则产生相互纠缠的策略子群,显然阻碍了在固定搭档处理中促使参与者完全合作的自选择过程。对后者的更细致分析显示,可观察到类似 AllC、AllD、TFT 和 WSLS 的行为。本研究还表明,需要进行长期处理,因为少于 25 轮的实验主要捕捉到的是参与者在此类实验中所经历的学习阶段。

关键词

引用

@article{arxiv.2202.04171,
  title  = {Inferring Strategies from Observations in Long Iterated Prisoner's Dilemma Experiments},
  author = {Eladio Montero-Porras and Jelena Grujic and Elias Fernandez-Domingos and Tom Lenaerts},
  journal= {arXiv preprint arXiv:2202.04171},
  year   = {2024}
}