FLAMES:通过细粒度分析数据合成管线提升大语言模型数学推理能力
机器学习
2025-08-25 v1 人工智能
计算与语言
摘要
最近的研究通过合成数据提升大语言模型数学推理能力,采用了独特的设置,使得数据合成策略的比较实际上难以实现。这留下了许多未解的问题关于不同因素在合成数据管线中的作用,例如过滤低质量问题的影响。为此,我们引入FLAMES(Framework for LLM Assessment of Math rEasoning Data Synthesis,即大语言模型数学推理数据合成评估框架),并系统研究了10种现有数据合成策略以及其他多个影响合成数学推理数据性能的因素。我们的FLAMES实验提供了关于合成数据难度与多样性最佳平衡的几个宝贵见解。首先,旨在增加问题复杂度的数据代理在大多数数学指标上取得最佳改进。其次,在固定的数据生成预算下,保持更高的问题覆盖率比只保留可靠解答的问题更为重要。第三,基于GSM8K和MATH的合成数据可在竞赛级别基准测试中实现改进,展示了易到难的泛化。利用我们的FLAMES实验所提供的见解,我们设计了两种新颖的数据合成策略,以提高域外泛化和鲁棒性。进一步,我们开发了FLAMES数据集,将我们的新颖策略与现有策略有效融合,在OlympiadBench上提升15.7分、CollegeMath提升4.5分、GSMPlus提升6.5分、MATH提升3.1分。对Qwen2.5-Math-7B在FLAMES数据集上微调可实现MATH上的81.4%准确率,超越了更大的Llama3 405B、GPT-4o和Claude 3.5 Sonnet。
引用
@article{arxiv.2508.16514,
title = {FLAMES: Improving LLM Math Reasoning via a Fine-Grained Analysis of the Data Synthesis Pipeline},
author = {Parker Seegmiller and Kartik Mehta and Soumya Saha and Chenyang Tao and Shereen Oraby and Arpit Gupta and Tagyoung Chung and Mohit Bansal and Nanyun Peng},
journal= {arXiv preprint arXiv:2508.16514},
year = {2025}
}
备注
To appear at EMNLP 2025