让我们逐步强化
计算与语言
2023-11-13 v1
摘要
尽管近期的进展提升了语言模型(LM)在语言基准测试中的能力,但 LM 在像数学这样的复杂任务上始终难以正确推理。我们转向基于人类反馈的强化学习(RLHF)作为一种塑造模型推理过程的方法。具体而言,我们探索了两种奖励方案,即结果监督奖励模型(ORM)和过程监督奖励模型(PRM),以优化逻辑推理。我们的结果表明,基于 PRM 的方法所提供的细粒度奖励提高了简单数学推理(GSM8K)的准确性,但出乎意料地降低了在复杂任务(MATH)上的表现。此外,我们展示了奖励聚合函数在模型性能中发挥的关键作用。我们的研究指出了有前景的未来研究方向,并强调了需要进一步探索细粒度奖励建模以构建更可靠的语言模型。
引用
@article{arxiv.2311.05821,
title = {Let's Reinforce Step by Step},
author = {Sarah Pan and Vladislav Lialin and Sherin Muckatira and Anna Rumshisky},
journal= {arXiv preprint arXiv:2311.05821},
year = {2023}
}
备注
NeurIPS 2023 Workshop on Instruction Tuning and Instruction Following