重复囚徒困境中β-核相关的动力系统
最优化与控制
2018-05-16 v1
摘要
我们考虑重复囚徒困境(PD)。我们假设参与者仅知道先前各阶段的平均收益来做出选择。参与者的策略是从收益集合的凸包到集合(其中表示合作,表示背叛)的一个函数。S. Smale在\cite{smale}中提出了重复PD中良好策略的思想。若双方均采取良好策略,则平均收益趋于PD中策略组合对应的收益。我们采纳Smale的思想来定义半合作策略——参与者不以策略组合对应的收益作为参考点,而是可以取属于PD的-核的任意收益。我们证明,若双方选择-核中同一点,则该策略组合是重复博弈中的均衡。若参与者选择-核中不同点,则平均收益序列趋于中的一点。所得极限可视为新博弈中的收益。在该新博弈中,参与者行动集为对应于-核收益的中的点集。
引用
@article{arxiv.1711.10923,
title = {Dynamical systems associated to the $\beta$-core in the repeated prisoner's dilemma},
author = {Sławomir Plaskacz and Joanna Zwierzchowska},
journal= {arXiv preprint arXiv:1711.10923},
year = {2018}
}
备注
21 pages, 12 figures