中文

ScaleDiff:用于高级数学推理的难题扩缩方法

机器学习 2025-09-26 v1 人工智能 计算与语言

摘要

大型推理模型(LRM)在复杂问题解决方面展现出惊人的能力,往往通过针对激发复杂推理的难数学问题进行训练来获得收益。近期的研究探索了通过引导专有模型或大规模开源模型从种子数据或内在数学概念自动合成数学问题。然而,由于高计算/API成本、引导复杂度以及生成问题的难度受限,这些方法的扩缩仍具有挑战性。为克服这些限制,我们提出了ScaleDiff,一个简单而有效的管道,旨在扩缩难问题的创建。我们仅通过一次前向传播即可使用自适应思考模型从现有数据集中高效识别难问题,该模型能够感知问题难度并自动在“思考”和“无思考”模式之间切换。随后,我们在此筛选后的难数据上训练一个专门的难问题生成器(DiffGen-8B),它能够大规模生成新的难问题,无需复杂的逐实例引导及其关联的高API成本。对Qwen2.5-Math-7B-Instruct在ScaleDiff-Math数据集上的微调,相较于原始数据集实现了11.3%的显著性能提升,并在AIME'24、AIME'25、HMMT-Feb'25、BRUMO'25和MATH500上的平均准确率达到65.9%,超越了如OpenThinker3等近期强大的LRM。值得注意的是,这一性能是通过使用成本高效的Qwen3-8B模型作为教师实现的,表明我们的管道能够在不依赖更大更昂贵教师模型的情况下有效传递先进的推理能力。此外,我们观察到模型在难题基准测试上的性能随难问题数量的增加而呈明显的扩缩现象。

关键词

引用

@article{arxiv.2509.21070,
  title  = {ScaleDiff: Scaling Difficult Problems for Advanced Mathematical Reasoning},
  author = {Qizhi Pei and Zhuoshi Pan and Honglin Lin and Xin Gao and Yu Li and Zinan Tang and Conghui He and Rui Yan and Lijun Wu},
  journal= {arXiv preprint arXiv:2509.21070},
  year   = {2025}
}

备注

15 pages