Phi-4-reasoning 技术报告
人工智能
2025-05-01 v1 计算与语言
摘要
我们介绍 Phi-4-reasoning,这是一个拥有 140 亿参数的推理模型,在复杂推理任务上取得优异性能。该模型通过对 Phi-4 进行监督式微调实现,训练数据经过精心挑选的“可教”提示语集合,这些提示语在复杂性和多样性方面达到了恰当的平衡,并使用 o3-mini 生成推理示范。Phi-4-reasoning 生成详细的推理链,有效利用推理时间计算资源。我们进一步开发了 Phi-4-reasoning-plus 版本,通过短暂的基于结果的强化学习提升,实现更高的性能,生成更长的推理轨迹。在广泛的推理任务中,两者都显著优于更大尺度的开源模型,如 DeepSeek-R1-Distill-Llama-70B 模型,并接近完整的 DeepSeek-R1 模型的性能水平。我们的全面评估涵盖数学和科学推理、编码、算法问题解决、规划和空间理解等各类基准测试。有趣的是,我们观察到对通用基准测试也能实现显著的迁移提升。本报告提供了我们训练数据、训练方法论以及评估结果的洞见。我们展示了在监督式微调中进行严谨数据挑选的优势同样适用于推理语言模型,并且这种优势可以通过强化学习进一步放大。最终,我们的评估指向了改进推理模型性能和鲁棒性评估方法的机会。
引用
@article{arxiv.2504.21318,
title = {Phi-4-reasoning Technical Report},
author = {Marah Abdin and Sahaj Agarwal and Ahmed Awadallah and Vidhisha Balachandran and Harkirat Behl and Lingjiao Chen and Gustavo de Rosa and Suriya Gunasekar and Mojan Javaheripi and Neel Joshi and Piero Kauffmann and Yash Lara and Caio César Teodoro Mendes and Arindam Mitra and Besmira Nushi and Dimitris Papailiopoulos and Olli Saarikivi and Shital Shah and Vaishnavi Shrivastava and Vibhav Vineet and Yue Wu and Safoora Yousefi and Guoqing Zheng},
journal= {arXiv preprint arXiv:2504.21318},
year = {2025}
}