中文

记忆不对称性在零和博弈学习中产生至纳什均衡的异宿轨道

计算机科学与博弈论 2024-02-19 v4 多智能体系统 最优化与控制 混沌动力学

摘要

博弈中的学习研究多个智能体如何通过重复博弈最大化自身收益。记忆,即智能体根据先前博弈的动作历史改变其动作的能力,常被引入学习中以探索更聪明的策略并讨论如人类等真实智能体的决策。然而,此类带记忆的博弈难以分析,因为它们表现出混沌动态或偏离纳什均衡等复杂现象。特别是,智能体间记忆容量的不对称性如何影响博弈学习仍不清楚。为此,本研究构建了具有非对称记忆容量的博弈中的梯度上升算法。为获得对学习动态的理论洞察,我们首先考虑零和博弈的简单情形。我们观察到复杂行为,其中学习动态绘制了从不稳定不动点到稳定不动点的异宿连接。尽管存在这种复杂性,我们分析学习动态并证明向这些稳定不动点(即纳什均衡)的局部收敛。我们识别出驱动此收敛的机制:具有更长记忆的智能体学会利用另一方,这反过来赋予另一方的效用函数严格凹性。我们进一步在数值上观察到这种收敛在各种初始策略、动作数和记忆长度下均成立。本研究揭示了由记忆不对称性引起的新现象,为博弈学习提供了基础性进展并为计算均衡提供了新见解。

关键词

引用

@article{arxiv.2305.13619,
  title  = {Memory Asymmetry Creates Heteroclinic Orbits to Nash Equilibrium in Learning in Zero-Sum Games},
  author = {Yuma Fujimoto and Kaito Ariu and Kenshi Abe},
  journal= {arXiv preprint arXiv:2305.13619},
  year   = {2024}
}

备注

9 pages & 5 figures (main), 5 pages & 2 figures (appendix)