在(含噪)迭代囚徒困境中平衡合作性与适应性
计算机科学与博弈论
2023-03-08 v1
摘要
自Axelrod的开创性工作以来,竞赛一直是评估迭代囚徒困境(IPD)中策略的主要基准。在这项工作中,我们首先提出一种用于IPD的策略,当在Axelrod库中的239种策略上进行评估、且IPD噪声水平从0%到10%时,该策略优于以往的竞赛冠军。我们策略背后的基本思想是:先玩一种宽恕无端背叛的以牙还牙(tit-for-tat)变体(若背叛率未显著高于噪声水平则宽恕),同时建立对手的(记忆-1)模型;然后切换到对对手模型最优适应的策略。接着我们指出,上述策略(像其他著名策略一样)缺乏一些竞赛未能充分检验、但在其他情境下相关的可取性质:我们希望策略能自我合作,即即便在高噪声水平下也能以高概率与自身克隆合作;并且希望它能诱导合作,即针对它的最优应对应以高概率合作。我们表明,通过在适当条件下从适应对手的策略回退到宽恕的以牙还牙策略,可以以竞赛性能上的适度代价保证这些性质。
引用
@article{arxiv.2303.03519,
title = {Balancing Cooperativeness and Adaptiveness in the (Noisy) Iterated Prisoner's Dilemma},
author = {Adrian Hutter},
journal= {arXiv preprint arXiv:2303.03519},
year = {2023}
}
备注
17 pages, 4 figures