中文

迭代囚徒困境中的策略

计算机科学与博弈论 2021-11-30 v2

摘要

我们探索了一些在迭代囚徒困境(IPD)中表现良好的策略。首先,我们展示了以牙还牙(Tit-For-Tat)策略在演化博弈论中的重要性。随后,我们对零行列式(zero-determinant, ZD)策略进行了理论推导,并指出原始 ZD 策略论文[6]中关于尺度参数界限的一个错误。接着,我们给出此类策略的示例,并受马尔可夫决策过程启发创建了一个自定义参与者(player)。最后,我们让所有策略相互对抗,观察它们在 IPD 锦标赛中的表现。

关键词

引用

@article{arxiv.2111.11561,
  title  = {Strategies for the Iterated Prisoner's Dilemma},
  author = {Anagh Malik},
  journal= {arXiv preprint arXiv:2111.11561},
  year   = {2021}
}