GameBench:评估 LLM 智能体战略推理能力的基准测试
计算与语言
2024-07-23 v2 人工智能
摘要
大型语言模型在众多自然语言理解任务上展现出惊人的零样性能。尽管已有多个案例表明大型语言模型可用于复杂的战略情景中,但缺乏对各种推理类型进行全面评估的框架。为填补这一空白,我们引入 GameBench,一个用于评估 LLM 智能体战略推理能力的跨领域基准测试。我们聚焦于 9 个不同的游戏环境,每个环境至少覆盖战略游戏中识别的一种关键推理技能轴向,并选择那些策略解释不太可能占据模型预训练语料库显著部分的游戏。我们的评估使用 GPT-3 和 GPT-4 原生版本,以及两种旨在增强战略推理能力的框架:链式思维 (Chain-of-Thought, CoT) 提示和推理式计划 (Reasoning Via Planning, RAP)。我们的结果表明,测试中的所有模型都未达到人类水平性能,最差情况下 GPT-4 的表现甚至低于随机行动。CoT 和 RAP 均提升了得分,但与人类水平相当不了。
引用
@article{arxiv.2406.06613,
title = {GameBench: Evaluating Strategic Reasoning Abilities of LLM Agents},
author = {Anthony Costarelli and Mat Allen and Roman Hauksson and Grace Sodunke and Suhas Hariharan and Carlson Cheng and Wenjie Li and Joshua Clymer and Arjun Yadav},
journal= {arXiv preprint arXiv:2406.06613},
year = {2024}
}