中文

多主体演化学习在随机博弈中的动力学:从多稳定性与混沌到稳定合作

物理与社会 2026-01-13 v1

摘要

实现稳健的协调与合作是多主体强化学习(MARL)中的核心挑战。揭示此类涌现行为背后机制的动力学理解至关重要。本文研究了在随机博弈中基于演化学习的智能体动力学,关注熵正则化的影响。通过利用时间尺度分离,我们推导了系统的演化方程,并运用动力系统理论进行形式化分析。我们发现,在掷硬币匹配博弈的常数和博弈中,系统表现出混沌行为。熵正则化缓解了这种混沌,使系统动力学趋向公平合作的收敛。在另一方面,在囚徒困境的一般和博弈中,系统显示出多稳定现象。有趣的是,系统的三个稳定平衡点对应于进化博弈论(EGT)中众所周知的ALLC(总是合作)、ALLD(总是背叛)和GRIM(恐慌触发)策略。熵正则化通过扩大合作平衡的吸引域,增强了系统的韧性。我们的发现揭示了直接互惠机制在EGT中与合作在MARL中涌现方式之间的密切联系,为设计更具韧性和协作性的多主体系统提供了启示。

关键词

引用

@article{arxiv.2601.07142,
  title  = {Dynamics of Multi-Agent Actor-Critic Learning in Stochastic Games: from Multistability and Chaos to Stable Cooperation},
  author = {Yuxin Geng and Wolfram Barfuss and Feng Fu and Xingru Chen},
  journal= {arXiv preprint arXiv:2601.07142},
  year   = {2026}
}