中文

重复囚徒困境中多智能体强化学习的对称均衡

计算机科学与博弈论 2021-06-02 v3 物理与社会

摘要

我们研究重复囚徒困境博弈,其中双方交替使用强化学习以获得其最优记忆一策略。我们从理论上求解了强化学习的同步 Bellman 最优方程。我们发现,在胜留败走(Win-stay Lose-shift)策略、冷酷(Grim)策略以及总是背叛的策略之间,可在所有确定性记忆一策略中形成互强化学习过程的对称均衡。

关键词

引用

@article{arxiv.2101.11861,
  title  = {Symmetric equilibrium of multi-agent reinforcement learning in repeated prisoner's dilemma},
  author = {Yuki Usui and Masahiko Ueda},
  journal= {arXiv preprint arXiv:2101.11861},
  year   = {2021}
}

备注

29 pages, 6 figures