中文

Math-Shepherd: 无需人工标注的 LLMs 逐步验证与强化

人工智能 2024-02-20 v3 计算与语言 机器学习

摘要

在本文中,我们提出了一种创新的面向过程的数学过程奖励模型,称为 \textbf{Math-Shepherd},它为数学问题解答的每一步分配一个奖励分数。Math-Shepherd 的训练是使用自动构建的逐步监督数据完成的,打破了现有工作严重依赖人工标注的瓶颈。我们探讨了 Math-Shepherd 在两种场景下的有效性:1) \textit{验证}:Math-Shepherd 用于对大型语言模型 (LLMs) 生成的多个输出进行重排序;2) \textit{强化学习}:Math-Shepherd 被用于通过逐步近端策略优化 (PPO) 来强化 LLMs。在 Math-Shepherd 的帮助下,一系列开源 LLMs 展现出卓越的性能。例如,使用 Math-Shepherd 的逐步 PPO 显著提高了 Mistral-7B 的准确率(在 GSM8K 上 77.9\%\to84.1\%,在 MATH 上 28.6\%\to33.0\%)。在 Math-Shepherd 的验证下,GSM8K 和 MATH 上的准确率分别可以进一步提高到 89.1\% 和 43.5\%。我们相信,自动过程监督对 LLMs 的未来演化具有巨大潜力。

关键词

引用

@article{arxiv.2312.08935,
  title  = {Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations},
  author = {Peiyi Wang and Lei Li and Zhihong Shao and R. X. Xu and Damai Dai and Yifei Li and Deli Chen and Y. Wu and Zhifang Sui},
  journal= {arXiv preprint arXiv:2312.08935},
  year   = {2024}
}

备注

Add Step-by-Step reinforcement learning results