Qwen2.5-Math 技术报告:通过自我改进实现数学专家模型
计算与语言
2024-09-19 v1 人工智能
机器学习
摘要
本报告介绍了一系列数学专用大型语言模型:Qwen2.5-Math 和 Qwen2.5-Math-Instruct-1.5B/7B/72B。Qwen2.5 系列的核心创新在于贯穿整个管道的自我改进哲学,从 pre-training 到 post-training 再到 inference:(1) 在 pre-training 阶段,使用 Qwen2-Math-Instruct 生成大规模高质量数学数据。(2) 在 post-training 阶段,我们通过对 Qwen2-Math-Instruct 进行大规模抽样开发奖励模型 (RM),该 RM 应用于监督微调 (SFT) 中数据的迭代演化。拥有更强 SFT 模型后,可以迭代训练和更新 RM,从而指导下一轮 SFT 数据迭代。在最终 SFT 模型上,我们使用最终 RM 进行强化学习,得到 Qwen2.5-Math-Instruct。(3) 此外,在 inference 阶段,使用 RM 指导采样,优化模型性能。Qwen2.5-Math-Instruct 支持中文和英文,具备先进的数学推理能力,包括 Chain-of-Thought (CoT) 和 Tool-Integrated Reasoning (TIR)。我们在中英文 10 个数学数据集上评估我们的模型,如 GSM8K、MATH、GaoKao、AMC23 和 AIME24,涵盖从小学水平到数学竞赛问题的各种难度。
引用
@article{arxiv.2409.12122,
title = {Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement},
author = {An Yang and Beichen Zhang and Binyuan Hui and Bofei Gao and Bowen Yu and Chengpeng Li and Dayiheng Liu and Jianhong Tu and Jingren Zhou and Junyang Lin and Keming Lu and Mingfeng Xue and Runji Lin and Tianyu Liu and Xingzhang Ren and Zhenru Zhang},
journal= {arXiv preprint arXiv:2409.12122},
year = {2024}
}