论监督式精调与强化学习在后训练中的非解耦性
机器学习
2026-05-07 v2 人工智能
信息论
math.IT
摘要
大型语言模型的后训练过程通常交替进行监督式精调(SFT)与强化学习(RL)。这两种方法目标不同:SFT通过最小化模型输出与专家响应之间的交叉熵损失来实现,而RL则通过源自人类偏好或基于规则的验证器来最大化奖励信号。现代推理模型广泛采用交替进行SFT和RL训练的做法。然而,目前尚无理论阐述阐明它们是否可实现解耦。我们证明了在两种顺序下均无法实现解耦:(1) SFT后置于RL:在分布(基于KL)和景观(基于PL)分析下,RL会增加SFT损失;(2) RL后置于SFT:在类似条件下,SFT会降低RL所实现的奖励。在PL条件下,我们进一步推导了平衡奖励提升与SFT退化的最优RL持续时间,识别了支配RL能否改善SFT的非解耦阈值,并通过谱聚类方法界定梯度错位。Qwen3-0.6B模型上的实验确认了预测的退化,验证了在后训练流程中,SFT与RL无法在不损失先前性能的前提下分离。
引用
@article{arxiv.2601.07389,
title = {On the Non-decoupling of Supervised Fine-tuning and Reinforcement Learning in Post-training},
author = {Xueyan Niu and Bo Bai and Wei Han and Weixi Zhang},
journal= {arXiv preprint arXiv:2601.07389},
year = {2026}
}