中文

更多数据还是更好数据?数学推理中数据选择与合成的批判性分析

计算与语言 2025-10-09 v1

摘要

大型语言模型(LLM)的推理能力在许多下游任务中起着关键作用,但强烈依赖于训练数据的质量。尽管提出了各种数据构建方法,但它们在现实世界流水线中的实际效用仍未得到充分探索。在这项工作中,我们对用于数学推理的开源数据集和数据合成技术进行了全面分析,并在一个旨在模拟训练和部署场景的统一流水线下对它们进行评估。我们进一步提炼了有效的数据选择策略,并确定了适合工业应用的实用方法。我们的研究结果表明,以更具可解释性的格式构建数据,或从更强的模型中蒸馏,往往比简单地扩大数据量更为重要。这项研究为整合训练数据以增强 LLM 能力提供了可操作的指导,支持了成本效益高的数据整理和可扩展的模型增强。我们希望这项工作能激发更多关于如何在现实世界推理任务中平衡“更多数据”与“更好数据”的研究。

关键词

引用

@article{arxiv.2510.07169,
  title  = {More Data or Better Data? A Critical Analysis of Data Selection and Synthesis for Mathematical Reasoning},
  author = {Yike Zhao and Simin Guo and Ziqing Yang and Shifan Han and Dahua Lin and Fei Tan},
  journal= {arXiv preprint arXiv:2510.07169},
  year   = {2025}
}

备注

12 pages, 3 figures, submitted to EMNLP 2025 Industry Track