中文

用于博弈“So Long Sucker”的竞争性多智能体强化

人工智能 2025-10-16 v2

摘要

本文将策略博弈 So Long Sucker (SLS) 作为多智能体强化学习(MARL)的新基准进行研究。与传统的棋盘或电子游戏测试平台不同,SLS 以其联盟形成、策略欺骗和动态淘汰规则为特征,使其成为对自主智能体而言极具挑战性的独特环境。我们引入了首个公开可用的 SLS 计算框架,包含图形用户界面和对强化学习算法的基准测试支持。使用经典的深度强化学习方法(例如 DQN、DDQN 和 Dueling DQN),我们训练了自博弈智能体以学习 SLS 的规则和基本策略。实验结果表明,尽管这些智能体获得了大约最大可获得奖励的一半,并始终优于随机基线,但它们需要很长的训练周期(约 2000 局博弈)并且仍会偶尔犯非法动作,这突显了经典强化学习的前景与局限性。我们的发现将 SLS 确立为面向 MARL 的具有谈判意识的基准,为未来整合博弈论推理、联盟感知策略和高级强化学习架构的研究开辟了途径,以更好地捕捉复杂多智能体博弈的社会和对抗动态。

关键词

引用

@article{arxiv.2411.11057,
  title  = {Reinforcing Competitive Multi-Agents for Playing 'So Long Sucker'},
  author = {Medant Sharan and Chandranath Adak},
  journal= {arXiv preprint arXiv:2411.11057},
  year   = {2025}
}