首步优势:多步数学推理中正确起步的重要性
计算与语言
2024-07-02 v3
摘要
语言模型可以通过学习为其预测生成推理过程来更好地解决复杂推理任务。这些模型通常知道如何解决某个任务,但其自回归解码特性若起步错误便会导致不正确结果。我们观察到,较小的模型在得到纠正后尤其能够解决原本难以处理的任务。我们通过用较大的模型引导较小的模型来展示这一现象,其带来显著提升(7B 模型在 GSM8K 数据集上最高 +24 分)。为协助较小模型发起起始步骤,我们提出 QuestCoT:较小模型先自问如何起步,再进行推理链。在多个较小模型上的各类多步数学推理数据集上,我们表明获得正确起步可带来所有模型的显著性能提升(GSM8K 上最高 +6 分,SVAMP 上 +9,ASDiv 上 +5,MultiArith 上 +7)。
引用
@article{arxiv.2311.07945,
title = {First-Step Advantage: Importance of Starting Right in Multi-Step Math Reasoning},
author = {Kushal Jain and Moritz Miller and Niket Tandon and Kumar Shridhar},
journal= {arXiv preprint arXiv:2311.07945},
year = {2024}
}