中文

收益景观与迭代博弈中自私优化的鲁棒性

计算机科学与博弈论 2022-07-07 v2 种群与进化

摘要

在迭代博弈中,参与者可以通过谨慎选择策略来单方面对结果施加影响。Press 和 Dyson(2012)发现了这类“收益控制”策略的一个强大类别。他们所谓的“零行列式”(ZD)策略允许参与者单方面强制建立两位参与者收益之间的线性关系。Chen 和 Zinger(2014)随后证明,当该线性关系的斜率为正时,ZD 策略对自私优化的对手具有鲁棒有效性,即自私参与者的所有适应路径都导致双方的最大收益(至少当博弈参数有某些限制时)。在本文中,我们在更一般的设定下,针对 ZD 和非 ZD 策略,研究固定对手下自私学习的效果。我们首先证明,在任何对称 2×22\times 2 博弈中,自私参与者的最终策略必为某种形式且不能是全随机的。然后我们表明,存在囚徒困境交互,其中自私优化并不总能在面对具有正斜率的固定 ZD 策略时导致最大收益。我们给出导致局部而非全局最优收益的 selfish 适应路径示例,削弱了收益控制策略的鲁棒性。对于非 ZD 策略,这些病态现象无论博弈参数原有的限制如何都会出现。我们的结果阐明了实现鲁棒收益控制和自私优化的困难,即便在对抗固定策略这一最简单情境下也是如此。

关键词

引用

@article{arxiv.2111.14246,
  title  = {Payoff landscapes and the robustness of selfish optimization in iterated games},
  author = {Arjun Mirani and Alex McAvoy},
  journal= {arXiv preprint arXiv:2111.14246},
  year   = {2022}
}

备注

26 pages; final version