中文

利用基于过程与基于结果的反馈解决数学应用题

机器学习 2022-11-28 v1 人工智能 计算与语言

摘要

近期研究表明,让语言模型生成推理步骤可提升其在许多推理任务上的表现。当不止于提示工程时,这引出了应如何监督此类模型的问题:是基于结果的方法(监督最终结果),还是基于过程的方法(监督推理过程本身)?人们自然预期这些方法之间的差异不仅体现在最终答案错误上,也体现在推理错误上,而推理错误难以检测且在教育等许多现实领域中存在问题。我们首次在自然语言任务 GSM8K 上对基于过程和基于结果的方法进行了全面比较。我们发现,纯基于结果监督以更少的标注监督产生了相似的最终答案错误率。然而,对于正确的推理步骤,我们发现有必要使用基于过程的监督或来自模拟基于过程反馈的习得奖励模型的监督。总体而言,我们将先前最佳结果从最终答案错误 16.8% \to 12.7%、最终答案正确解中的推理错误 14.0% \to 3.4% 进行了改进。

关键词

引用

@article{arxiv.2211.14275,
  title  = {Solving math word problems with process- and outcome-based feedback},
  author = {Jonathan Uesato and Nate Kushman and Ramana Kumar and Francis Song and Noah Siegel and Lisa Wang and Antonia Creswell and Geoffrey Irving and Irina Higgins},
  journal= {arXiv preprint arXiv:2211.14275},
  year   = {2022}
}