中文

OpenGuanDan:大规模不完全信息游戏基准

人工智能 2026-02-03 v1 多智能体系统

摘要

数据驱动的人工智能 (AI),特别是机器学习的进步,严重依赖大规模基准测试。尽管近几十年来从模式识别到智能决策等诸多领域取得了显著进展,尤其在棋类、牌类和电子竞技类游戏中取得了突破性成果,但仍迫切需要更具挑战性的基准来推动进一步的研究。为此,本文提出 OpenGuanDan,一种新型基准,旨在高效模拟关东坦(一种流行的四玩家、多轮中国牌游戏)并全面评估基于学习和基于规则的关东坦 AI 智能体。OpenGuanDan 提出一系列非平凡挑战,包括不完全信息、大规模信息集合和动作空间、涉及合作与竞争的混合学习目标、长期决策、可变动作空间以及动态队伍组成。这些特征使其成为现有智能决策方法的严峻测试场。此外,每个玩家的独立 API 允许人机交互并支持与大型语言模型的集成。我们进行了两种类型的评估: (1) 所有关东坦 AI 智能体之间的两两竞赛, (2) 人机对战。实验结果表明,尽管当前基于学习的智能体在实力上显著优于基于规则的对手,但仍未达到超人水平,这凸显了在多智能体智能决策领域需要持续研究的紧迫性。该项目已公开于 https://github.com/GameAI-NJUPT/OpenGuanDan。

关键词

引用

@article{arxiv.2602.00676,
  title  = {OpenGuanDan: A Large-Scale Imperfect Information Game Benchmark},
  author = {Chao Li and Shangdong Yang and Chiheng Zhan and Zhenxing Ge and Yujing Hu and Bingkun Bao and Xingguo Chen and Yang Gao},
  journal= {arXiv preprint arXiv:2602.00676},
  year   = {2026}
}