中文

重复囚徒困境博弈中针对零行列式策略的适应路径

计算机科学与博弈论 2022-07-18 v2

摘要

个体间的长期合作、竞争或剥削可通过重复博弈建模。在重复博弈中,Press与Dyson发现了零行列式(ZD)策略,其强制玩家间的一种特殊关系。这一特殊关系意味着ZD玩家可单方面将线性收益关系强加于对手,而不论对手策略如何。ZD玩家还具有一种性质:若对手试图改善其收益,可引导对手走向无条件合作。该性质已由Chen与Zinger从数学上证实。人类常低估未来获得的收益。然而他们的分析未考虑此种折扣。此处我们从数学上探究即便引入折扣因子,ZD玩家是否仍能引导对手走向无条件合作。具体而言,我们将带折扣因子的期望收益表示为行列式的形式,并计算策略向量中各因子偏微分所得值是否为正。结果我们证明即便从任意初始策略出发,策略向量最终仍归于无条件合作。该结果通过数值计算得以确认。我们将ZD策略的适用性扩展至现实世界问题。

关键词

引用

@article{arxiv.2111.00479,
  title  = {Adapting paths against zero-determinant strategies in repeated prisoner's dilemma games},
  author = {Daiki Miyagawa and Azumi Mamiya and Genki Ichinose},
  journal= {arXiv preprint arXiv:2111.00479},
  year   = {2022}
}

备注

28 pages, 11 figures, and 6 tables