中文

批判微调: 通过学习批判优于学习模仿

计算与语言 2025-04-01 v4

摘要

监督式微调 (Supervised Fine-Tuning, SFT) 常用于训练语言模型以模仿给定指令的注释响应。本文提出批判式微调 (Critique Fine-Tuning, CFT),该方法在推理任务中优于SFT。与简单模仿正确响应不同,CFT训练模型批判带噪声的响应,灵感来自人类学习过程中的批判性思维、深入分析和细致理解——这些特征常被标准SFT忽视。为验证CFT的有效性,我们构建了多个批判数据集(如WebInstruct、MetaMath、NuminaMath),其中GPT-4o作为教师生成以 ([查询; 噪声响应], 批判) 形式的批判。实验表明,在六个数学推理基准测试中,CFT consistently 超过SFT 4-10%,且适用于不同的基础模型,包括Qwen2.5、Qwen2.5-Math和DeepSeek-Math。值得注意的是,我们的模型Qwen2.5-Math-CFT仅需在8台H100上用50K个样本训练1小时,却能在大多数基准测试中匹配或优于Qwen2.5-Math-Instruct(使用超过200万样本),而SimpleRL是一种使用计算资源是Qwen2.5-Math-Instruct的140倍的DeepSeek-r1复制品。此外,在IF_Eval和MT-Bench上的实验进一步表明,CFT能显著提升模型的通用生成和指令遵循能力,优于Qwen2.5-Math-Instruct。消融研究表明,CFT对噪声响应来源和教师批判模型具有鲁棒性。这些发现表明,CFT为推进语言模型推理提供了更有效的替代方案。

关键词

引用

@article{arxiv.2501.17703,
  title  = {Critique Fine-Tuning: Learning to Critique is More Effective than Learning to Imitate},
  author = {Yubo Wang and Xiang Yue and Wenhu Chen},
  journal= {arXiv preprint arXiv:2501.17703},
  year   = {2025}
}