Modeling human reputation-seeking behavior in a spatio-temporally complex public good provision game
多智能体系统
2025-06-09 v1
摘要
多智能体强化学习算法在其他理论方法(如博弈论)无法处理的复杂社会环境中用于模拟社会行为。然而,它们尚未得到来自具有真实人类参与者的实验室实验的实证支持。在本工作中,我们展示了如何使用多智能体强化学习来建模名为 Clean Up 的空间和时间复杂的公共物品提供游戏中的群体行为。我们表明,当人类群体能够识别彼此并在时间段中跟踪声誉时,Clean Up 问题得以成功解决,但在匿名条件下则会失败。一种新的基于声誉的合作多智能体强化学习模型也展示了可识别与匿名条件之间的相同差异。此外,人类群体和人工智能体群体都通过轮流进行解决问题,尽管其他选项也可供选择。我们的结果凸显了利用多智能体强化学习来建模复杂环境中人类社会行为的优势。
引用
@article{arxiv.2506.06032,
title = {Modeling human reputation-seeking behavior in a spatio-temporally complex public good provision game},
author = {Edward Hughes and Tina O. Zhu and Martin J. Chadwick and Raphael Koster and Antonio García Castañeda and Charles Beattie and Thore Graepel and Matthew M. Botvinick and Joel Z. Leibo},
journal= {arXiv preprint arXiv:2506.06032},
year = {2025}
}
备注
45 pages, 29 figures. arXiv admin note: substantial text overlap with arXiv:2103.04982