逐步奖励:作为推理导航器的步级奖励模型
计算与语言
2023-10-17 v1
摘要
近年来,大语言模型(LLMs)在多步推理方面取得了显著进展。先前研究已阐明在模型推理过程中集成反馈或搜索机制以提高推理准确性的优势。过程监督奖励模型(PRM)通常在训练阶段为 LLM 提供逐步反馈,类似于近端策略优化(PPO)或拒绝采样。我们的目标是在推理阶段检验 PRM 的功效,以助辨别数学推理与代码生成等多步任务的最优解路径。为此,我们提出一种启发式贪心搜索算法,利用 PRM 的步级反馈优化 LLM 探索的推理路径。该定制 PRM 在 GSM8K 与 MATH 等数学基准上相较思维链(CoT)展现出增强的结果。此外,为探索方法的通用性,我们开发了一种自动生成代码任务步级奖励数据集的新方法,并观察到代码生成任务中类似的性能提升。从而凸显了我们基于奖励模型的推理推断方法的鲁棒性。
引用
@article{arxiv.2310.10080,
title = {Let's reward step by step: Step-Level reward model as the Navigators for Reasoning},
author = {Qianli Ma and Haotian Zhou and Tingkai Liu and Jianbo Yuan and Pengfei Liu and Yang You and Hongxia Yang},
journal= {arXiv preprint arXiv:2310.10080},
year = {2023}
}