中文

SFT-RL 后训练中的泥潭:当高 SFT 分数误导以及应对之道

机器学习 2025-10-03 v1 人工智能 计算与语言

摘要

在为推理型大语言模型进行后训练的当前实践中,训练流程包含两个独立阶段:监督微调(SFT)和基于可验证奖励的强化学习(RLVR,以下简称 RL)。本文我们质疑高 SFT 分数是否必然导致 RL 后的性能提升。我们提供了大量反例表明这并非必然如此。我们发现,高 SFT 分数可能偏向更简单或更均匀的数据,不能可靠预测后续 RL 收益或规模化后训练效果。在某些情况下,对 SFT 表现提升的模型进行 RL,可能导致与在无 SFT 的基础模型上进行 RL 相比,效果大幅下降。我们研究了替代指标,确定在 held-out 推理样本上的泛化损失和 Pass@large k 性能可为 RL 结果提供强有力的代理指标。我们使用 SFT 和 RLVR 通过 GRPO 训练了数百个最高达 120 亿参数的模型,并在 7 个数学基准上进行了最多 256 次重复的广泛评估,消耗超过 100 万 GPU 小时。实验包括来自 Llama3、Mistral-Nemo、Qwen3 以及多个最先进 SFT/RL 数据集。与直接从事前 RL 性能预测相比,基于泛化损失和 Pass@large k 的预测在提升 R² 系数和斯佩曼等相关系数方面显著提高,最高提升约 0.5(翻倍)。这为广泛应用提供了强大的实用价值。例如,在大多数实验中,我们发现仅使用唯一样本进行单轮 SFT 训练,低于使用相同样本数进行两轮训练的效果更好,无论是仅 SFT 还是 SFT 后再 RL;在相同 SFT 预算下,仅训练短示例可能获得更好的 SFT 表现,但往往导致 RL 后效果更差,这与在长度各异的示例上训练相比。我们将开源评估工具。

关键词

引用

@article{arxiv.2510.01624,
  title  = {Quagmires in SFT-RL Post-Training: When High SFT Scores Mislead and What to Use Instead},
  author = {Feiyang Kang and Michael Kuchnik and Karthik Padthe and Marin Vlastelica and Ruoxi Jia and Carole-Jean Wu and Newsha Ardalani},
  journal= {arXiv preprint arXiv:2510.01624},
  year   = {2025}
}

备注

Preprint. Under Review