关于SFT泛化的论述:基于强化学习视角的奖励校正
机器学习
2026-03-02 v3
摘要
在本工作中,我们提出了一种简单却具有理论依据的改进方法,用于改进大型语言模型(LLM)的监督微调(SFT),以提升其泛化能力。通过数学分析,我们揭示了标准SFT梯度隐式地编码了一种可能严重限制模型泛化能力的异常奖励结构。为此,我们提出了动态微调(\model),通过动态调整目标函数来稳定每个token的梯度更新。该方法仅需一行代码,即可在多个困难基准测试和基础模型上超越标准SFT,涵盖数学推理、代码生成和多模态任务等,显示出 improved 的泛化能力。此外,\model 在离线强化学习环境中也能实现竞争成绩,为提升SFT水平提供了一种有效且简洁的替代方案。通过将理论洞察与实际解决方案相结合,本工作推动了SFT技术的发展。源代码将在https://github.com/yongliang-wu/DFT 上提供。
引用
@article{arxiv.2508.05629,
title = {On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification},
author = {Yongliang Wu and Yizhou Zhou and Zhou Ziheng and Yingzhe Peng and Xinyu Ye and Xinting Hu and Wenbo Zhu and Lu Qi and Ming-Hsuan Yang and Xu Yang},
journal= {arXiv preprint arXiv:2508.05629},
year = {2026}
}
备注
ICLR 2026