中文

通过生成游戏衡量通用智能

人工智能 2025-05-13 v1

摘要

我们提出gg-bench,一套用于评估语言模型通用推理能力的游戏环境集合。不同于大多数静态基准,gg-bench是可生成数据的过程,新评估实例可随意生成。具体而言,gg-bench通过以下步骤合成生成:(1) 使用大语言模型(LLM)生成新游戏的自然语言描述;(2) 使用LLM以Gym环境形式实现每个游戏;(3)通过自我对弈训练强化学习(RL)智能体。我们通过语言模型对这些RL智能体的胜率来评估模型。具体做法是,给定游戏描述、当前棋盘状态与合法移动列表,模型输出其愿意执行的移动。gg-bench具有挑战性:最先进的LLM如GPT-4o和Claude 3.7 Sonnet仅以零样本学习实现7-9%的胜率,而推理模型如o1、o3-mini和DeepSeek-R1实现平均31-36%的胜率。我们公开生成的游戏、数据生成过程及评估代码,以支持未来的建模工作和基准扩展。

关键词

引用

@article{arxiv.2505.07215,
  title  = {Measuring General Intelligence with Generated Games},
  author = {Vivek Verma and David Huang and William Chen and Dan Klein and Nicholas Tomlin},
  journal= {arXiv preprint arXiv:2505.07215},
  year   = {2025}
}