中文

经验回放创新动力学

机器学习 2025-01-28 v2 计算机科学与博弈论 多智能体系统

摘要

尽管强化学习在多智能体环境中取得了突破性进展,但仍面临不稳定性和非平稳性问题。复制动力学作为进化博弈论中最著名的模型,为轨迹收敛至纳什均衡提供了理论框架,因而被用于确保多智能体强化学习算法在稳定博弈环境中的形式保证。然而,它们在其他环境中表现为相反行为,导致亟需寻找替代方案以确保收敛。相较之下,诸如 Brown-von Neumann-Nash (BNN) 或 Smith 动力学等创新动力学产生周期性轨迹,有望逼近纳什均衡。然而,目前尚无基于这些动力学的多智能体强化学习算法被提出。为此,我们开发了一种基于经验回放的新型多智能体强化学习算法,引入可调节的修订协议作为超参数。我们通过合理调整修订协议,证明该算法的行为与上述动力学轨迹相吻合。重要的是,我们的贡献提供了一种框架,能够将多智能体强化学习算法的理论保证扩展至复制动力学之外。最后,我们用实验结果验证了理论发现。

关键词

引用

@article{arxiv.2501.12199,
  title  = {Experience-replay Innovative Dynamics},
  author = {Tuo Zhang and Leonardo Stella and Julian Barreiro-Gomez},
  journal= {arXiv preprint arXiv:2501.12199},
  year   = {2025}
}