中文

MuSR:以多步软推理测试思维链的极限

计算与语言 2024-03-26 v2

摘要

尽管配备思维链提示等技术的大语言模型(LLMs)已展现令人印象深刻的能力,它们在复杂设定中稳健推理的能力仍显不足。然而,评估 LLM 推理具有挑战性,因为系统能力持续增长,而逻辑演绎等任务的基准数据集却保持静态。我们提出 MuSR,一个用于评估语言模型在自然语言叙事中指定的多步软推理任务的数据集。该数据集有两个关键特征。第一,它通过一种新颖的神经符号合成到自然生成算法创建,能够构建挑战 GPT-4 的复杂推理实例(例如约 1000 字长度的谋杀谜题),并可随更强 LLMs 的发布进一步扩展。第二,我们的数据集实例对应真实世界推理领域的自由文本叙事;这使其同时比其它合成基准更具挑战性,又保持现实且便于人类标注者高精度求解。我们在该数据集上评估一系列 LLMs 与提示技术,并刻画了诸如思维链等技术实现稳健推理所存差距。

关键词

引用

@article{arxiv.2310.16049,
  title  = {MuSR: Testing the Limits of Chain-of-thought with Multistep Soft Reasoning},
  author = {Zayne Sprague and Xi Ye and Kaj Bostrom and Swarat Chaudhuri and Greg Durrett},
  journal= {arXiv preprint arXiv:2310.16049},
  year   = {2024}
}