中文

强化学习演化博弈中集体行为的振荡演化

物理与社会 2019-08-09 v1 适应与自组织系统

摘要

大规模合作支撑着生态系统与人类社会的演化,而多智能体系统自组织产生的集体行为是理解该问题的关键。随着人工智能(AI)几乎渗透到科学的所有分支,从多智能体AI系统中获得关于集体行为的新见解颇具意义。在此,我们将一种典型的强化学习(RL)算法——Q学习引入演化博弈动力学,其中智能体基于内省而非传统演化博弈(EG)中的生灭或模仿过程来追求最优行动。我们针对一般的2×22\times 2博弈设置数值研究了合作普遍程度。我们发现,在大多数情况下,多智能体AI中的合作普遍程度与传统EG中惊人地处于同一水平。然而,在采用RL的雪堆博弈中,我们也揭示了爆炸性合作以周期振荡的形式出现,并研究了收益结构对其涌现的影响。最后,我们表明在某些其他采用RL算法的EG(如石头-剪刀-布博弈)中也可观察到周期振荡。我们的结果为从AI视角理解自然与社会中合作与振荡行为的涌现提供了一个参考点。

关键词

引用

@article{arxiv.1908.03060,
  title  = {Oscillatory evolution of collective behavior in evolutionary games played with reinforcement learning},
  author = {Si-Ping Zhang and Ji-Qiang Zhang and Li Chen and Xu-Dong Liu},
  journal= {arXiv preprint arXiv:1908.03060},
  year   = {2019}
}

备注

10 pages, 7 figures