中文

互惠与勒索策略:无限迭代囚徒困境

物理与社会 2019-11-28 v3 生物物理

摘要

囚徒困境博弈在社会、生物与物理科学中拥有悠久历史。2012 年,Press 与 Dyson 基于马尔可夫链分析与记忆一阶策略,提出了一种将无限迭代囚徒困境博弈中 8 维策略轮廓映射到 2 维收益空间的方法。我们推广了该方法并引入策略参数概念,以表明玩家收益间的线性关系是无限迭代囚徒困境博弈中普遍存在的特征。我们将扩展分析应用于包括以牙还牙、赢留输变及其他随机化策略集在内的多种策略轮廓。我们识别出映射到 2 维收益(得分)空间中囚徒困境四边形顶点、边及内部的策略轮廓。DaMD 策略仅基于“相互背叛后的背叛”定义,并利用策略参数分析得出玩家得分间的线性关系。研究表明,无论对手策略如何,DaMD 策略都会使其使用者获得相对于另一玩家的相等(互惠)或更大(勒索)得分。当 DaMD 玩家在冲突博弈后(合作-背叛或背叛-合作)选择合作的概率之和小于 1 时,出现勒索得分。当 DaMD 玩家在冲突博弈后选择合作的概率之和等于 1 时,出现相等的互惠得分。当一方选择勒索型 DaMD 时,对手亦选择 DaMD 策略即可在无限迭代囚徒困境中迫使双方获得相等的惩罚收益。文中讨论了基于 DaMD 实现相互合作的潜在途径。

关键词

引用

@article{arxiv.1803.01282,
  title  = {Reciprocal and Extortive Strategies: Infinitely Iterated Prisoner's Dilemma},
  author = {Robert D. Young},
  journal= {arXiv preprint arXiv:1803.01282},
  year   = {2019}
}