LLM-BABYBENCH:理解和评估LLM中基于 grounding的规划与推理
人工智能
2025-05-20 v1 计算与语言
摘要
评估大型语言模型(LLM)在交互式环境约束下的规划与推理能力,是发展有能力AI智能体的关键。我们引入,一个新构建的基准套件,专为此目的而设计。基于对程序生成的BabyAI网格世界的文本化适应,本套件评估LLM在三个基本方面上的 grounded 智力:(1)预测动作对环境状态影响的能力(任务),(2)生成低层动作序列以实现指定目标的能力(任务),(3)将高层指令分解为连贯子目标序列的能力(任务)。我们详细描述了为生成三个相应数据集(、、)的方法,通过从 operate within 文本环境的专家智能体中提取结构化信息。此外,我们提供了标准化的评估套件和指标,包括用于验证生成计划的环境交互,以便可重复评估多种LLM。初始基线结果突显了这些 grounded 推理任务所面临的挑战。该基准套件、数据集、数据生成代码和评估代码均已公开可用。
关键词
引用
@article{arxiv.2505.12135,
title = {LLM-BABYBENCH: Understanding and Evaluating Grounded Planning and Reasoning in LLMs},
author = {Omar Choukrani and Idriss Malek and Daniil Orel and Zhuohan Xie and Zangir Iklassov and Martin Takáč and Salem Lahlou},
journal= {arXiv preprint arXiv:2505.12135},
year = {2025}
}