中文

通过从零开始的可扩展问题合成释放 LLM 推理能力

计算与语言 2025-05-28 v2 人工智能

摘要

提高大型语言模型(LLM)的数学推理能力是推进人工智能的关键挑战。然而,获取大规模、多样且高质量的推理数据集仍是一个重大挑战,尤其是对开源社区而言。本文提出了ScaleQuest,一种新颖的、可扩展的且高性价比的数据合成方法,使其能够使用轻量级7B规模的模型生成大规模的数学推理数据集。ScaleQuest引入了两个阶段的问题调优过程,包括问题精细调优(QFT)和问题偏好优化(QPO),以释放问题生成能力。通过从零开始生成多样化问题——无需依赖强大的专有模型或初始数据——我们产生了100万组问题-解对数据集。我们的实验表明,在领域内和领域外评估中,基于我们数据训练的模型在现有开源数据集上具有优势。此外,我们的方法在训练数据量增加时表现出持续的性能提升,凸显了其在持续数据扩展方面的潜力。我们所观察到的在代码推理任务中的显著性能提升,显示出我们方法的泛化能力。我们的工作为开源社区提供了一个实用的解决方案,以提升LLM的数学推理能力。

关键词

引用

@article{arxiv.2410.18693,
  title  = {Unleashing LLM Reasoning Capability via Scalable Question Synthesis from Scratch},
  author = {Yuyang Ding and Xinyu Shi and Xiaobo Liang and Juntao Li and Zhaopeng Tu and Qiaoming Zhu and Min Zhang},
  journal= {arXiv preprint arXiv:2410.18693},
  year   = {2025}
}

备注

ACL 2025