中文

逐步验证

机器学习 2023-06-01 v1 人工智能 计算与语言

摘要

近年来,大语言模型在执行复杂多步推理方面的能力大幅提升。然而,即便是最先进的模型仍会规律性地产生逻辑错误。为训练更可靠的模型,我们可以采用结果监督(对最终结果提供反馈)或过程监督(对每一个中间推理步骤提供反馈)。鉴于训练可靠模型的重要性以及人类反馈的高成本,仔细比较这两种方法十分关键。近期已有研究开始此类比较,但许多问题尚待解答。我们开展了自己的研究,发现对于训练模型求解具有挑战性的MATH数据集中的问题,过程监督显著优于结果监督。我们的过程监督模型在MATH测试集的一个代表性子集上解决了78%的问题。此外,我们表明主动学习显著提升了过程监督的有效性。为支持相关研究,我们还发布了PRM800K,即用于训练我们最佳奖励模型的、包含80万步级人类反馈标签的完整数据集。

关键词

引用

@article{arxiv.2305.20050,
  title  = {Let's Verify Step by Step},
  author = {Hunter Lightman and Vineet Kosaraju and Yura Burda and Harri Edwards and Bowen Baker and Teddy Lee and Jan Leike and John Schulman and Ilya Sutskever and Karl Cobbe},
  journal= {arXiv preprint arXiv:2305.20050},
  year   = {2023}
}