中文

AceMath:通过后训练与奖励建模推动数学推理的前沿突破

计算与语言 2025-01-20 v2 人工智能 机器学习

摘要

本文介绍了 AceMath,一个在解决复杂数学问题方面表现卓越的数学模型套件,以及高度有效的奖励模型,能够可靠地评估生成的解答并识别正确答案。为开发指令调优的数学模型,我们提出一种监督微调(SFT)过程:首先在通用领域实现竞争性能,再针对数学领域使用精心策划的提示集合和合成生成的响应进行针对性微调。得到的模型 AceMath-72B-Instruct 在 Qwen2.5-Math-72B-Instruct、GPT-4o 和 Claude-3.5 Sonnet 方面均表现出色。为开发数学专用奖励模型,我们首先构建 AceMath-RewardBench,这是一个全面且稳健的基准,用于评估跨不同问题和难度水平的数学奖励模型。随后,我们提出系统化的方法构建数学奖励模型。得到的模型 AceMath-72B-RM 在状态-of-the-art 奖励模型中持续领先。此外,当将 AceMath-72B-Instruct 与 AceMath-72B-RM 组合时,可在数学推理基准测试中实现最高的平均 rm@8 分数。我们将在 https://research.nvidia.com/labs/adlr/acemath 发布模型权重、训练数据及评估基准。

关键词

引用

@article{arxiv.2412.15084,
  title  = {AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling},
  author = {Zihan Liu and Yang Chen and Mohammad Shoeybi and Bryan Catanzaro and Wei Ping},
  journal= {arXiv preprint arXiv:2412.15084},
  year   = {2025}
}