中文

基于网格游戏竞赛的大型语言模型评估:一个可扩展的 LLM 基准与排行榜

人工智能 2024-07-12 v2 计算与语言 机器学习 神经与进化计算

摘要

我们通过井字棋、四子棋和五子棋等网格游戏,引入了一个新颖且可扩展的大型语言模型(LLM)基准。GitHub 上提供的开源游戏模拟代码允许 LLM 进行竞赛,并生成 JSON、CSV、TXT 和 PNG 格式的详细数据文件,用于排行榜排名和进一步分析。我们展示了领先 LLM 之间的游戏结果,包括 Anthropic 的 Claude 3.5 Sonnet 和 Claude 3 Sonnet、Google 的 Gemini 1.5 Pro 和 Gemini 1.5 Flash、OpenAI 的 GPT-4 Turbo 和 GPT-4o,以及 Meta 的 Llama3-70B。我们也鼓励其他 LLM 提交结果。我们总共在三种类型的游戏中模拟了 2,310 场比赛(7 个 LLM 和一个随机玩家之间每对进行 5 场会话),使用了三种不同的提示类型:列表、插图和图像。结果显示,LLM 在不同游戏和提示类型下的表现存在显著差异,分析涵盖了获胜率和失格率、错失机会分析和无效落子分析。排行榜和结果矩阵数据的详细信息可在 GitHub 上作为开放获取数据获得。本研究增强了我们对 LLM 在未受过专门训练的游戏中的能力的理解,有助于评估其规则理解和战略思维。在通往通用人工智能(AGI)的道路上,本研究为未来探索其在复杂决策场景中的效用奠定了基础,阐明了其战略思维能力,并为进一步探究 LLM 在游戏框架中的局限性提供了方向。

关键词

引用

@article{arxiv.2407.07796,
  title  = {Evaluating Large Language Models with Grid-Based Game Competitions: An Extensible LLM Benchmark and Leaderboard},
  author = {Oguzhan Topsakal and Colby Jacob Edell and Jackson Bailey Harper},
  journal= {arXiv preprint arXiv:2407.07796},
  year   = {2024}
}