中文

LLM-BABYBENCH:理解和评估LLM中基于 grounding的规划与推理

人工智能 2025-05-20 v1 计算与语言

摘要

评估大型语言模型(LLM)在交互式环境约束下的规划与推理能力,是发展有能力AI智能体的关键。我们引入LLM-BabyBench\textbf{LLM-BabyBench},一个新构建的基准套件,专为此目的而设计。基于对程序生成的BabyAI网格世界的文本化适应,本套件评估LLM在三个基本方面上的 grounded 智力:(1)预测动作对环境状态影响的能力(Predict\textbf{Predict}任务),(2)生成低层动作序列以实现指定目标的能力(Plan\textbf{Plan}任务),(3)将高层指令分解为连贯子目标序列的能力(Decompose\textbf{Decompose}任务)。我们详细描述了为生成三个相应数据集(LLM-BabyBench-Predict\texttt{LLM-BabyBench-Predict}-Plan\texttt{-Plan}-Decompose\texttt{-Decompose})的方法,通过从 operate within 文本环境的专家智能体中提取结构化信息。此外,我们提供了标准化的评估套件和指标,包括用于验证生成计划的环境交互,以便可重复评估多种LLM。初始基线结果突显了这些 grounded 推理任务所面临的挑战。该基准套件、数据集、数据生成代码和评估代码均已公开可用。

关键词

引用

@article{arxiv.2505.12135,
  title  = {LLM-BABYBENCH: Understanding and Evaluating Grounded Planning and Reasoning in LLMs},
  author = {Omar Choukrani and Idriss Malek and Daniil Orel and Zhuohan Xie and Zangir Iklassov and Martin Takáč and Salem Lahlou},
  journal= {arXiv preprint arXiv:2505.12135},
  year   = {2025}
}