PARADISE:基于程序性警告与提示数据集评估语言模型的隐式规划技能
计算与语言
2024-06-07 v3
摘要
最近,社区对大型语言模型是否具备规划或执行计划的能力越来越感兴趣。然而,大多数先前的研究使用LLM为缺乏语言复杂性和领域多样性的简化场景生成高层计划,限制了对模型规划能力的分析。这些设置限制了评估方法(例如预定义的动作空间)和架构选择(例如仅使用生成式模型),并忽略了对于现实分析至关重要的语言细微差别。为了解决这一问题,我们提出了PARADISE,这是一个基于wikiHow实用程序性文本的问答形式溯因推理任务。它涉及与目标直接相关的警告和提示推理任务,排除了中间步骤,旨在测试模型仅从给定目标推断计划隐式知识的能力。我们的实验利用了微调的语言模型和零样本提示,揭示了在大多数场景下,特定任务的小型模型相比大型语言模型的有效性。尽管取得了一些进展,但所有模型均未达到人类的表现水平。值得注意的是,我们的分析揭示了有趣的见解,例如模型在丢弃关键词时的行为变化,BERT系列和GPT-4在物理和抽象目标上的困难,以及所提出的任务为其他未见过的程序性任务提供了有价值的先验知识。PARADISE数据集及相关资源已在 https://github.com/GGLAB-KU/paradise 公开供进一步研究探索。
引用
@article{arxiv.2403.03167,
title = {PARADISE: Evaluating Implicit Planning Skills of Language Models with Procedural Warnings and Tips Dataset},
author = {Arda Uzunoglu and Abdalfatah Rashid Safa and Gözde Gül Şahin},
journal= {arXiv preprint arXiv:2403.03167},
year = {2024}
}
备注
9 pages, ACL 2024 Findings