通过单问题批判性微调释放预训练大语言模型的推理潜力
计算与语言
2025-06-06 v2 机器学习
摘要
我们观察到,Qwen-Math、MiMo和Phi-4等强大大语言模型继承了预训练阶段蕴含的巨大推理潜力。通过强化学习(RL),这些模型在推理任务上可以显著提升。近期研究表明,即使对单一问题进行RL也能释放这些模型的推理能力。然而,RL不仅昂贵而且不稳定。即使是单次RL也需要数百GPU小时。这引发了一个关键问题:是否有更高效的方法来释放这些强大基础大语言模型的推理潜力?在本文中,我们证明对单一问题进行批判性微调(CFT)可以有效释放大语言模型的推理潜力。我们的方法通过收集针对单一问题的多样化模型生成解,并使用教师大语言模型提供详细评注来构建批判性微调数据。我们对Qwen和Llama系列模型(从1.5B到14B参数)进行CFT微调,观察到在多样化推理任务上的显著性能提升。例如,仅需5 GPU小时的训练,Qwen-Math-7B-CFT在六个数学基准上平均提升15%,在三个逻辑推理基准上提升16%。这些结果与RL(计算量为20倍)相当甚至超越。消融研究表明单次CFT在不同提示问题上的鲁棒性。这些结果凸显了单次CFT作为一种简单、通用且计算高效的方法来释放现代大语言模型推理能力。
引用
@article{arxiv.2506.03295,
title = {Unleashing the Reasoning Potential of Pre-trained LLMs by Critique Fine-Tuning on One Problem},
author = {Yubo Wang and Ping Nie and Kai Zou and Lijun Wu and Wenhu Chen},
journal= {arXiv preprint arXiv:2506.03295},
year = {2025}
}