重复囚徒困境中多智能体强化学习的对称均衡
计算机科学与博弈论
2021-06-02 v3 物理与社会
摘要
我们研究重复囚徒困境博弈,其中双方交替使用强化学习以获得其最优记忆一策略。我们从理论上求解了强化学习的同步 Bellman 最优方程。我们发现,在胜留败走(Win-stay Lose-shift)策略、冷酷(Grim)策略以及总是背叛的策略之间,可在所有确定性记忆一策略中形成互强化学习过程的对称均衡。
引用
@article{arxiv.2101.11861,
title = {Symmetric equilibrium of multi-agent reinforcement learning in repeated prisoner's dilemma},
author = {Yuki Usui and Masahiko Ueda},
journal= {arXiv preprint arXiv:2101.11861},
year = {2021}
}
备注
29 pages, 6 figures