中文

GameTraversalBenchmark:通过遍历 2D 游戏地图评估大语言模型的规划能力

计算与语言 2024-10-11 v1 人工智能

摘要

大语言模型(LLM)最近在生成和理解自然语言方面取得了显著成功。尽管它们还显示出超越自然语言领域的潜力,但这些 LLM 在何种程度上以及以何种方式进行规划仍是一个开放问题。我们通过提出 GameTraversalBenchmark(GTB),由多样化的 2D 网格-based 游戏地图组成来探讨其规划能力。若 LLM 能在最少步骤数和最少生成错误数的情况下遍历给定目标,则成功。我们对 GTB 上多个 LLM 进行评估,发现 GPT-4-Turbo 在 GTB_Score(GTBS),该综合得分结合了上述三个准则的最高得分为 44.97\%。进一步地,我们初步测试大型推理模型,即 o1,在 GTBS 上得分 67.84%67.84\%,表明该基准对当前模型仍具有挑战性。代码、数据和文档均可用 https://github.com/umair-nasir14/Game-Traversal-Benchmark 获取。

关键词

引用

@article{arxiv.2410.07765,
  title  = {GameTraversalBenchmark: Evaluating Planning Abilities Of Large Language Models Through Traversing 2D Game Maps},
  author = {Muhammad Umair Nasir and Steven James and Julian Togelius},
  journal= {arXiv preprint arXiv:2410.07765},
  year   = {2024}
}

备注

Accepted at 38th Conference on Neural Information Processing Systems (NeurIPS 2024) Track on Datasets and Benchmarks