UFT:通过广义隐式奖励函数统一 SFT 和 RLHF/DPO/UNA 的微调
计算与语言
2026-05-11 v3 机器学习
摘要
通过在平坦的 trillions token 上预训练,LLM 获得文本生成能力。然而,为了增强其实用性并减少潜在危害,需要依次对预训练模型应用 SFT 和对齐。由于 SFT 和对齐具有不同的目标和底层过程,某些任务的性能可能下降。为此,我们引入统一微调 (UFT),通过隐式奖励函数将 SFT 和对齐无缝集成到单个训练阶段,使用相同的目标和损失函数。我们的实验结果表明,UFT 在仅使用指令调优数据的情况下也优于 SFT。此外,在将指令调优数据与对齐数据组合使用时,UFT 有效防止了这两个阶段上某些任务的性能下降,在依次应用 SFT 和对齐时表现出明显优势。这在针对指令跟随 \textbf{ifeval} 任务和事实性 \textbf{truthful} 任务上均表现突出。提出的通用微调框架 UFT 为 LLM 后训练建立了有效且高效的范式。
引用
@article{arxiv.2410.21438,
title = {UFT: Unifying Fine-Tuning of SFT and RLHF/DPO/UNA through a Generalized Implicit Reward Function},
author = {Zhichao Wang and Bin Bi and Zixu Zhu and Xiangbo Mao and Jun Wang and Shiyu Wang and Cheng Wang and Dong Nie and Lingzi Hong},
journal= {arXiv preprint arXiv:2410.21438},
year = {2026}
}