评估大语言模型在问答任务中关于元层次与对象层次推理能力
计算与语言
2025-02-17 v1 人工智能
摘要
大型语言模型(LLMs)在自然语言任务中表现出色,但在需要复杂多步骤推理的问答任务(Question Answering, QA)中仍面临挑战。我们概述了这些任务所需的推理类型,并以元层次推理(类似于高层次战略推理或规划)和对象层次推理(体现在数学推理等低层次任务中)的形式重新定义这些任务。我们介绍了一个要求元层次与对象层次推理的新型数据集 Franklin,并使用该数据集以及另外三个数据集来评估四个大型语言模型在需要多步骤推理的问答任务中的表现。人类标注研究的结果表明,大型语言模型在元层次推理方面表现频繁且较好,但在部分数据集中的对象层次推理任务中存在困难。此外,证据表明大型语言模型对Franklin数据集中问题所需的对象层次推理具有挑战性,然而它们仍在元层次推理要求方面表现出色。
引用
@article{arxiv.2502.10338,
title = {Evaluating the Meta- and Object-Level Reasoning of Large Language Models for Question Answering},
author = {Nick Ferguson and Liane Guillou and Alan Bundy and Kwabena Nuamah},
journal= {arXiv preprint arXiv:2502.10338},
year = {2025}
}
备注
8 pages. Accepted to the Workshop on Planning in the Era of LLMs (LM4Plan @ AAAI 2025)