GLoRe:何时、何处以及如何通过全局和局部精炼改进LLM推理
计算与语言
2024-06-26 v2 机器学习
摘要
最先进的语言模型在数学、科学或编程任务上可以展现出令人印象深刻的推理精炼能力。然而,最近的研究表明,即使是最好的模型,在无法获取外部反馈的情况下,也难以识别\textit{何时以及何处进行精炼}。基于结果的奖励模型(ORMs)经过训练可预测最终答案的正确性,指示何时进行精炼,为决定何时精炼提供了一种便捷的解决方案。基于过程的奖励模型(PRMs)经过训练可预测中间步骤的正确性,随后可用于指示何处进行精炼。但它们的训练成本高昂,需要大量的人工标注。在本文中,我们提出了逐步ORMs(SORMs),它们仅基于合成数据进行训练,用于近似最优策略或的期望未来奖励。更具体地说,SORMs经过训练,可预测在多次采样当前策略(而非像ORMs那样仅一次)时最终答案的正确性。我们的实验表明,与ORMs相比,SORMs能够更准确地检测出错误的推理步骤,从而在精炼时提高下游准确性。然后,我们训练了\textit{全局}精炼模型,该模型仅将问题和草稿解决方案作为输入,并预测修正后的解决方案;以及\textit{局部}精炼模型,该模型还输入一个指出第一个推理错误位置的批评。我们通过重复使用训练SORM所用的数据,以合成方式为这两个模型生成训练数据。我们发现,结合全局和局部精炼,并使用ORM作为重排序器,其性能显著优于单独使用任何一种方法,也优于三个样本的最佳基线。通过这种策略,我们可以将经过RL微调的LLaMA-2 13B模型在GSM8K上的贪婪采样准确率从53%提高到65%。
引用
@article{arxiv.2402.10963,
title = {GLoRe: When, Where, and How to Improve LLM Reasoning via Global and Local Refinements},
author = {Alex Havrilla and Sharath Raparthy and Christoforus Nalmpantis and Jane Dwivedi-Yu and Maksym Zhuravinskyi and Eric Hambro and Roberta Raileanu},
journal= {arXiv preprint arXiv:2402.10963},
year = {2024}
}