中文

基于间接互惠的混合动机博弈中学习公平合作

多智能体系统 2024-08-09 v1 计算机科学与博弈论

摘要

利他合作虽然代价高昂,但在社会上是可取的。因此,智能体难以通过独立强化学习(RL)学习到合作策略。间接互惠,即智能体考虑其交互伙伴的声誉,已被证明可以在同质、理想化的群体中稳定合作。然而,更现实的场景由具有不同特征和基于群体的社会身份的异质智能体组成。我们研究了当智能体被划分为两个这样的群体时的合作,并允许声誉更新和行动依赖于群体信息。我们考虑了两种建模方法:演化博弈论,我们全面搜索导致合作与公平的社会规范(即分配声誉的规则);以及RL,我们考虑策略学习的随机动力学如何影响分析确定的均衡。我们观察到,多数群体的背叛会导致少数群体也背叛,但反之则不然。此外,改变评判群体内和群体外交互的规范可以引导系统走向公平或不公平的合作。当超越均衡分析转向独立RL智能体时,这一点变得更加清晰,此时收敛到公平合作发生的规范集合更窄。我们的结果强调,在具有声誉的异质群体中,仔细定义交互规范是解决合作困境和公平困境的根本。

关键词

引用

@article{arxiv.2408.04549,
  title  = {Learning Fair Cooperation in Mixed-Motive Games with Indirect Reciprocity},
  author = {Martin Smit and Fernando P. Santos},
  journal= {arXiv preprint arXiv:2408.04549},
  year   = {2024}
}

备注

Main text (9 pages, 6 figures) and appendix (7 pages, 4 figures)