中文

GVGAI-LLM:用无限游戏评估大型语言模型智能体

人工智能 2026-05-19 v3

摘要

我们引入了GVGAI-LLM,这是一个用于评估大型语言模型(LLMs)推理和问题解决能力的视频游戏基准。它建立在通用视频游戏AI框架之上,包含一系列多样化的街机风格游戏,旨在测试模型处理与大多数现有LLM基准不同任务的能力。该基准利用一种视频游戏描述语言,能够快速创建新游戏(包括规则和关卡),有助于防止随时间推移的过拟合。每个游戏场景由一组紧凑的ASCII字符表示,允许语言模型进行高效处理。GVGAI-LLM定义了可解释的指标,包括有效步数比、步数效率和总分,以评估模型行为。通过在118个具有不同挑战和技能深度的游戏中进行零样本评估,我们揭示了LLM在空间推理和基本规划方面持续存在的局限性。当前模型始终表现出空间和逻辑错误,这促使了结构化提示和空间锚定技术的应用。尽管这些干预措施带来了部分改进,但该基准距离被解决仍然非常遥远。GVGAI-LLM作为一个可复现的测试平台,用于推进语言模型能力的研究,特别强调智能体行为和空间推理。此外,它能够手动和程序化地生成无限基准,为纵向评估提供了一个可扩展的框架。

关键词

引用

@article{arxiv.2508.08501,
  title  = {GVGAI-LLM: Evaluating Large Language Model Agents with Infinite Games},
  author = {Yuchen Li and Cong Lin and Muhammad Umair Nasir and Philip Bontrager and Jialin Liu and Julian Togelius},
  journal= {arXiv preprint arXiv:2508.08501},
  year   = {2026}
}