强化学习下双智能体重复博弈中合作的出现
物理与社会
2024-05-17 v2
摘要
合作是生态系统与人类社会的基石,而强化学习为其涌现机制提供了关键洞见。然而,以往大多数工作多聚焦于群体层面的自组织,个体层面的基本动力学仍不清楚。在此,我们研究双智能体系统中的合作演化,其中每个智能体依据经典 Q-learning 算法在严格囚徒困境中追求最优策略。我们揭示,强记忆与长远期期望会催生协调最优策略(COPs)的出现,此时两个智能体均表现为赢留输变(WSLS)以维持高水平合作。否则,玩家对其合作方背叛的容忍度增加,合作最终失去稳定性,全背叛(All-D)策略占据主导。这表明容忍可能是合作危机的良好前兆。此外,我们的分析表明,不同 COP 的协调最优模式(COMs)随着记忆减弱与未来期望降低而逐渐失去稳定性,此时智能体无法预测合作方在博弈中的行动,背叛占据主导。据此,我们给出了维持合作对未来期望与记忆强度的约束。与以往工作相反,探索对合作的影响并非一致,而是取决于 COMs 的构成。通过厘清该双人系统中的这些基本问题,我们希望自己的工作有助于理解现实更复杂情景中合作的出现与稳定性。
关键词
引用
@article{arxiv.2307.04612,
title = {Emergence of Cooperation in Two-agent Repeated Games with Reinforcement Learning},
author = {Zhen-Wei Ding and Guo-Zhong Zheng and Chao-Ran Cai and Wei-Ran Cai and Li Chen and Ji-Qiang Zhang and Xu-Ming Wang},
journal= {arXiv preprint arXiv:2307.04612},
year = {2024}
}
备注
29 pages,11 figures