中文

GFT:基于无偏组优势和动态系数校正的从模仿到奖励微调

人工智能 2026-05-05 v3 机器学习

摘要

大型语言模型通常采用监督微调(SFT)和强化学习(RL)进行后训练,但有效统一高效知识注入与稳健泛化仍具有挑战。在本工作中,我们提供一种训练动力学分析,表明SFT可解释为具有极度稀疏隐式奖励和不稳定逆概率加权的政策梯度优化的特例,这两者导致单路径依赖、熵塌陷和梯度爆炸。针对这一诊断,我们提出基于两项机制的统一后训练框架——群体微调(GFT):组优势学习构造多样化响应组并派生归一化对比监督以缓解奖励稀疏;动态系数校正自适应限制逆概率权重以稳定优化同时保持高效知识注入。实验表明,GFT consistently 超过 SFT-based 方法,生成的策略在后续 RL 训练中集成更顺畅。

关键词

引用

@article{arxiv.2604.14258,
  title  = {GFT: From Imitation to Reward Fine-Tuning with Unbiased Group Advantages and Dynamic Coefficient Rectification},
  author = {Wangjie Gan and Miao Pan and Linbo Xi and Wenqi Zhang and Jintao Chen and Jianwei Yin and Xuhong Zhang},
  journal= {arXiv preprint arXiv:2604.14258},
  year   = {2026}
}