中文

思考、修剪、训练、提升:无需扩大模型规模的推理扩展方法

机器学习 2025-04-28 v1

摘要

大型语言模型(LLMs)在编程和数学推理任务中展现出强大的能力,但受限于高质量训练数据的不足。合成数据可用于增强微调结果,但多个因素会影响这一过程,包括模型规模、合成数据volume、修剪策略以及微调轮数。我们探讨了这些维度,研究哪些条件能够实现模型自我提升。我们引入Think, Prune, Train process,这是一个可扩展的框架,通过迭代微调模型自身的推理痕迹,使用ground-truth pruning确保高质量训练数据。该方法产生了改进的性能:在GSM8K上,Gemma2-2B达到了57.6%的Pass@1(从41.9%提升),Gemma2-9B达到了82%,匹配LLaMA-3.1-70B,LLaMA-3.1-70B达到了91%,甚至超过GPT-4o,展示了自生成推理和系统性数据选择提高LLM能力的有效性。

关键词

引用

@article{arxiv.2504.18116,
  title  = {Think, Prune, Train, Improve: Scaling Reasoning without Scaling Models},
  author = {Caia Costello and Simon Guo and Anna Goldie and Azalia Mirhoseini},
  journal= {arXiv preprint arXiv:2504.18116},
  year   = {2025}
}