中文

WizardMath:通过强化 Evol-Instruct 赋能大语言模型的数学推理

计算与语言 2025-06-05 v3 人工智能 机器学习

摘要

大语言模型(LLMs),如 GPT-4,在自然语言处理(NLP)任务中展现出卓越性能,包括具有挑战性的数学推理。然而,大多数现有开源模型仅在大规模互联网数据上预训练,未经数学相关优化。本文提出 WizardMath,通过将我们提出的基于 Evol-Instruct 反馈的强化学习(RLEIF)方法应用于数学领域,在不使用外部 python 工具的情况下增强 LLM 的数学 CoT 推理能力。通过在 GSM8k 与 MATH 两个数学推理基准上的大量实验,我们揭示了模型的出色能力。值得注意的是,WizardMath-Mistral 7B 以更高的数据效率大幅超越顶级开源 LLM。此外,WizardMath 70B 甚至优于 GPT-3.5-Turbo、Claude 2、Gemini Pro 与 GPT-4-early-version。另外,我们的初步探索强调了指令进化与过程监督在取得优异数学表现中的关键作用。更多细节见 https://github.com/nlpxucan/WizardLM

关键词

引用

@article{arxiv.2308.09583,
  title  = {WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct},
  author = {Haipeng Luo and Qingfeng Sun and Can Xu and Pu Zhao and Jianguang Lou and Chongyang Tao and Xiubo Geng and Qingwei Lin and Shifeng Chen and Yansong Tang and Dongmei Zhang},
  journal= {arXiv preprint arXiv:2308.09583},
  year   = {2025}
}

备注

This paper has been accepted to ICLR 2025 as an Oral presentation