中文

Phi-4-Mini-Reasoning:探索小规模推理语言模型的数学能力极限

计算与语言 2025-05-01 v1

摘要

链律思考(CoT)通过训练大型语言模型(LLM)显式生成中间推理步骤来显著提升其形式推理能力。尽管LLM从这些技术中获益颇丰,但在小型语言模型(SLM)方面提升推理能力仍具有挑战性,由于其有限的模型容量。最近的工作表明, 从LLM生成的合成数据提取可以显著提高SLM的推理能力,但详细的建模配方尚未披露。在本工作中,我们提出一套系统性的SLM训练配方,包括四个步骤:(1)大规模中期训练 diverse distilled long-CoT 数据,(2)在高质量 long-CoT 数据上的监督微调,(3)利用精心策选的偏好数据集进行 Rollout DPO,(4)使用可验证奖励的强化学习。我们将其方法应用于Phi-4-Mini,该模型参数量为38亿。结果表明,Phi-4-Mini-Reasoning模型在数学推理任务中超过了更大规模的推理模型,例如,在Math-500上超过DeepSeek-R1-Distill-Qwen-7B提升了3.2分,超过DeepSeek-R1-Distill-Llama-8B提升了7.7分。我们的结果表明,经过精心设计的训练配方,配合大规模高质量CoT数据,能够在资源受限的小型模型中发掘出强大的推理能力。

关键词

引用

@article{arxiv.2504.21233,
  title  = {Phi-4-Mini-Reasoning: Exploring the Limits of Small Reasoning Language Models in Math},
  author = {Haoran Xu and Baolin Peng and Hany Awadalla and Dongdong Chen and Yen-Chun Chen and Mei Gao and Young Jin Kim and Yunsheng Li and Liliang Ren and Yelong Shen and Shuohang Wang and Weijian Xu and Jianfeng Gao and Weizhu Chen},
  journal= {arXiv preprint arXiv:2504.21233},
  year   = {2025}
}