Math-Shepherd: 无需人工标注的 LLMs 逐步验证与强化
人工智能
2024-02-20 v3 计算与语言
机器学习
摘要
在本文中,我们提出了一种创新的面向过程的数学过程奖励模型,称为 \textbf{Math-Shepherd},它为数学问题解答的每一步分配一个奖励分数。Math-Shepherd 的训练是使用自动构建的逐步监督数据完成的,打破了现有工作严重依赖人工标注的瓶颈。我们探讨了 Math-Shepherd 在两种场景下的有效性:1) \textit{验证}:Math-Shepherd 用于对大型语言模型 (LLMs) 生成的多个输出进行重排序;2) \textit{强化学习}:Math-Shepherd 被用于通过逐步近端策略优化 (PPO) 来强化 LLMs。在 Math-Shepherd 的帮助下,一系列开源 LLMs 展现出卓越的性能。例如,使用 Math-Shepherd 的逐步 PPO 显著提高了 Mistral-7B 的准确率(在 GSM8K 上 77.9\%84.1\%,在 MATH 上 28.6\%33.0\%)。在 Math-Shepherd 的验证下,GSM8K 和 MATH 上的准确率分别可以进一步提高到 89.1\% 和 43.5\%。我们相信,自动过程监督对 LLMs 的未来演化具有巨大潜力。
引用
@article{arxiv.2312.08935,
title = {Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations},
author = {Peiyi Wang and Lei Li and Zhihong Shao and R. X. Xu and Damai Dai and Yifei Li and Deli Chen and Y. Wu and Zhifang Sui},
journal= {arXiv preprint arXiv:2312.08935},
year = {2024}
}
备注
Add Step-by-Step reinforcement learning results