面向 On-Policy SFT:分布判别理论及其在大语言模型训练中的应用
机器学习
2026-03-17 v2 人工智能
计算机视觉与模式识别
摘要
监督微调(SFT)计算效率高,但常常表现出劣于强化学习(RL)的泛化能力。这一差距主要由 RL 采用 on-policy 数据所致。我们提出一种框架,以实现 On-Policy SFT。首先,我们提出了《分布判别理论(Distribution Discriminant Theory, DDT)》,用于解释和量化数据与模型诱导分布之间的对齐程度。基于 DDT,我们引入两种互补技术:(i)《分布内微调(In-Distribution Finetuning, IDFT)》,一种基于损失水平的方法,以提升 SFT 的泛化能力;(ii)《引导解码(Hinted Decoding)》,一种数据层面的技术,可重新对齐训练语料库以匹配模型分布。大量实验表明,我们的框架在 generalization 性能上超越了包括 DPO 和 SimPO 在内的多数离线 RL 算法,同时保持 SFT 流水线的效率。该框架因此提供了一个在 RL 不可行的领域中实用的替代方案。我们在此公开代码:https://github.com/zhangmiaosen2000/Towards-On-Policy-SFT
引用
@article{arxiv.2602.12222,
title = {Towards On-Policy SFT: Distribution Discriminant Theory and its Applications in LLM Training},
author = {Miaosen Zhang and Yishan Liu and Shuxia Lin and Xu Yang and Qi Dai and Chong Luo and Weihao Jiang and Peng Hou and Anxiang Zeng and Xin Geng and Baining Guo},
journal= {arXiv preprint arXiv:2602.12222},
year = {2026}
}