中文

代码推理的谷底:大型语言模型知识蒸馏的规模化

计算与语言 2025-10-08 v1

摘要

将具有推理能力的大型语言模型(LLM)的思考痕迹蒸馏到较小模型已被证明有效。然而,关于模型性能随蒸馏数据数量变化的研究仍显不足。本文研究了在两个小型非推理LLM上进行编程技能蒸馈的规模化趋势。我们验证了存在一个“代码推理的谷底”:随着数据量增加,竞赛编程任务的下游性能首先下降,然后以快于线性的速度稳定上升。我们识别了这一趋势后,进一步在同一数据集上在两个不同的蒸馈阶段进行微调,以奠定各自学习阶段的结论。我们发现,尽管小模型在低和中等偏低数据 regimes 下,从更容易的编程问题中受益更大,而非来自更难的编程问题。我们还发现,出人意料的是,训练数据中输出的正确性对蒸馏结果没有影响。我们的工作代表了对代码推理蒸馈训练动力学的一步进步,超越直觉认识。

关键词

引用

@article{arxiv.2510.06101,
  title  = {The Valley of Code Reasoning: Scaling Knowledge Distillation of Large Language Models},
  author = {Muyu He and Muhammad Ali Shafique and Anand Kumar and Tsach Mackey and Nazneen Rajani},
  journal= {arXiv preprint arXiv:2510.06101},
  year   = {2025}
}

备注

NeurIPS 2025 Workshop on Deep Learning for Code (DL4C), Project page: https://collinear.ai/valley-of-reasoning