基于质量多样性算法的 SPARQ:合成问题生成用于推理
机器学习
2025-06-18 v2 人工智能
摘要
大型语言模型驱动的合成数据生成已成为提高模型推理能力的强大方法。然而,大多数方法要么通过将大型最先进模型蒸馏到小型学生模型,要么使用自然真实问题语句保证问题语句质量。这限制了这些方法在更复杂和多样的问题领域的可扩展性。为此,我们提出 SPARQ:合成问题生成用于推理 via 质量多样性算法—a 一种仅通过衡量问题解答率(问题难度的代理指标)来生成高质量且多样化的合成数学问题和解答对的新方法。我们从 7500 个样本的种子数据集开始,生成超过 2000 万个新的问题解答对。我们表明,按难度筛选后的数据用于微调可使模型性能提升最高 24%。此外,我们进行消融研究,研究合成数据的数量、质量和多样性对模型泛化的影响。我们发现,按难度衡量的更高质量有助于改善在分布内性能;尽管生成多样化的合成数据对在分布内性能的提升不如前者,但筛选更具多样性的数据有助于提高 OOD 泛化能力。我们还确认了模型和数据规模律在合成问题生成中的存在,这些规模律正面影响下游模型的泛化。
引用
@article{arxiv.2506.06499,
title = {SPARQ: Synthetic Problem Generation for Reasoning via Quality-Diversity Algorithms},
author = {Alex Havrilla and Edward Hughes and Mikayel Samvelyan and Jacob Abernethy},
journal= {arXiv preprint arXiv:2506.06499},
year = {2025}
}