GIFT:通过有限温度吉布斯初始化协调训练后目标
机器学习
2026-03-19 v2 人工智能
计算与语言
摘要
大型推理模型(LRM)当前主流的训练后范式——即监督微调(SFT)后接强化学习(RL)——存在内在的优化不匹配问题:SFT 中固有的严格监督会导致分布坍缩,从而耗尽后续 RL 所需的探索空间。在本文中,我们重新表述 SFT 以协调训练后目标,并提出了有限温度吉布斯初始化(GIFT)。我们将标准 SFT 描述为抑制基础先验的退化零温度极限。相反,GIFT 将监督作为有限温度能量势纳入,建立了一个分布桥梁,以在整个训练后流程中促进目标一致性。我们的实验表明,当用于 RL 初始化时,GIFT 显著优于标准 SFT 和其他具有竞争力的基线方法,为保留探索能力并对齐两个训练后阶段提供了一条数学上有原则的途径。我们的代码可在 https://github.com/zzy1127/GIFT 获取。
引用
@article{arxiv.2601.09233,
title = {GIFT: Reconciling Post-Training Objectives via Finite-Temperature Gibbs Initialization},
author = {Zhengyang Zhao and Lu Ma and Yizhen Jiang and Xiaochen Ma and Zimo Meng and Chengyu Shen and Lexiang Tang and Haoze Sun and Peng Pei and Wentao Zhang},
journal= {arXiv preprint arXiv:2601.09233},
year = {2026}
}