空间囚徒困境博弈中的状态-动作-奖励-状态-动作算法
人工智能
2024-06-26 v1
摘要
合作行为在人类社会和自然界中都普遍存在。理解自利个体之间合作行为的涌现和维持仍然是进化生物学和社会科学中的一个重大挑战。强化学习为研究进化博弈论提供了一个合适的框架,因为它能够适应环境变化并最大化预期收益。在本研究中,我们采用状态-动作-奖励-状态-动作算法作为进化博弈论中个体的决策机制。首先,我们将SARSA应用于模仿学习,其中智能体根据奖励选择要模仿的邻居。这种方法使我们能够观察没有独立决策能力的智能体的行为变化。随后,SARSA被用于主要智能体独立地选择与邻居合作或背叛。我们通过分析奖励的变化以及网络中合作者和背叛者的分布,评估了SARSA对合作率的影响。
引用
@article{arxiv.2406.17326,
title = {The State-Action-Reward-State-Action Algorithm in Spatial Prisoner's Dilemma Game},
author = {Lanyu Yang and Dongchun Jiang and Fuqiang Guo and Mingjian Fu},
journal= {arXiv preprint arXiv:2406.17326},
year = {2024}
}