中文

语言模型是贪婪的推理者:对思维链的系统形式化分析

计算与语言 2023-03-03 v4

摘要

大型语言模型(LLMs)在给定思维链提示(含中间推理步骤的示例)时展现出显著的推理能力。现有基准通过评估数学推理等下游任务的准确率来间接衡量推理能力。然而,这些模型如何得出答案、以及它们是否依赖简单启发式而非生成的思维链尚不清楚。为系统探究 LLMs 的推理能力,我们提出一个名为 PrOntoQA 的新型合成问答数据集,其中每个示例由一阶逻辑表示的合成世界模型生成。这使我们能将生成的思维链解析为符号证明以进行形式化分析。我们对 InstructGPT 与 GPT-3 的分析表明,LLMs 颇能做出正确的单步演绎,因而通常具备推理能力,即便在虚构语境中亦然。然而,它们在证明规划上存在困难:当多个有效演绎步骤可用时,它们无法系统地探索不同选项。

关键词

引用

@article{arxiv.2210.01240,
  title  = {Language Models Are Greedy Reasoners: A Systematic Formal Analysis of Chain-of-Thought},
  author = {Abulhair Saparov and He He},
  journal= {arXiv preprint arXiv:2210.01240},
  year   = {2023}
}

备注

Published as a conference paper at ICLR 2023