重复囚徒困境博弈中形成对称互强化学习均衡的记忆二策略
物理与社会
2023-01-03 v2 计算机科学与博弈论
摘要
我们研究了当两名玩家在重复囚徒困境博弈中交替学习针对对手的最优记忆二策略时,互强化学习的对称均衡。我们给出了记忆二确定性策略形成对称均衡的必要条件。然后我们给出了三个形成对称互强化学习均衡的记忆二确定性策略的例子。我们还证明了由记忆二策略形成的互强化学习均衡在两名玩家均使用记忆-n(n>2)策略的强化学习时也是互强化学习均衡。
引用
@article{arxiv.2108.03258,
title = {Memory-two strategies forming symmetric mutual reinforcement learning equilibrium in repeated prisoners' dilemma game},
author = {Masahiko Ueda},
journal= {arXiv preprint arXiv:2108.03258},
year = {2023}
}
备注
26 pages