True Detective:一个 GPT-3 无法解决而 GPT-4 也难以应对的深度溯因推理基准
计算与语言
2023-06-05 v2
摘要
大语言模型(LLMs)已展现出扎实的零样本推理能力,这体现在它们在当前测试任务上的表现中。这呼唤一个需要高度进阶推理能力才能解决的更具挑战性的基准。在本文中,我们引入这样一个基准,其由 191 篇长篇(平均 1200 词)神秘叙事构成,这些叙事被构建为侦探谜题。谜题来源于“5 Minute Mystery”平台,并包含一个用于评估的多项选择题。平均而言仅有 47% 的人类成功解出谜题,而最优秀的人类解题者成功率超过 80%。我们表明,GPT-3 模型在该基准上仅勉强优于随机水平(准确率为 28%),而最先进的 GPT-4 仅解出 38% 的谜题。这表明 LLMs 与人类在深度推理能力上仍存在显著差距,并凸显了该领域进一步研究的必要性。我们的工作为未来关于语言模型推理的研究引入了一个具有挑战性的基准,并有助于更好地理解 LLMs 能力的局限。
引用
@article{arxiv.2212.10114,
title = {True Detective: A Deep Abductive Reasoning Benchmark Undoable for GPT-3 and Challenging for GPT-4},
author = {Maksym Del and Mark Fishel},
journal= {arXiv preprint arXiv:2212.10114},
year = {2023}
}
备注
5 pages, to appear at *SEM