中文

PokéChamp:一个专家级极小极大语言智能体

机器学习 2025-03-07 v1 多智能体系统

摘要

我们介绍了 PokéChamp,一个用于宝可梦对战的极小极大智能体,由大型语言模型(LLMs)驱动。该智能体基于一个通用的双人对战游戏框架,利用 LLMs 的通用能力来增强极小极大树搜索。具体而言,LLMs 替换了三个关键模块:(1)玩家动作采样,(2)对手建模,以及(3)价值函数估计,使智能体能够有效利用游戏历史和人类知识来缩小搜索空间并应对部分可观测性。值得注意的是,我们的框架不需要额外的 LLM 训练。我们在流行的 Gen 9 OU 格式中评估了 PokéChamp。当由 GPT-4o 驱动时,它对现有最佳基于 LLM 的智能体取得了 76% 的胜率,对最强的基于规则的智能体取得了 84% 的胜率,展示了其优越的性能。即使使用开源的 80 亿参数 Llama 3.1 模型,PokéChamp 也能持续超越之前最佳的基于 LLM 的智能体——由 GPT-4o 驱动的 Pokéllmon,胜率为 64%。PokéChamp 在 Pokémon Showdown 在线天梯上获得了预计 Elo 评分 1300-1500,使其跻身排名前 30%–10% 的人类玩家之列。此外,这项工作汇编了最大规模的真实玩家宝可梦对战数据集,包含超过 300 万场对战,其中包括超过 50 万场高 Elo 评分对战。基于该数据集,我们建立了一系列对战基准和谜题,以评估特定的对战技能。我们还提供了本地游戏引擎的关键更新。我们希望这项工作能促进进一步的研究,利用宝可梦对战作为基准,将 LLM 技术与博弈论算法相结合,以解决通用的多智能体问题。视频、代码和数据集可在 https://sites.google.com/view/pokechamp-llm 获取。

关键词

引用

@article{arxiv.2503.04094,
  title  = {Pok\'eChamp: an Expert-level Minimax Language Agent},
  author = {Seth Karten and Andy Luu Nguyen and Chi Jin},
  journal= {arXiv preprint arXiv:2503.04094},
  year   = {2025}
}

备注

24 pages, 13 figures