中文

GIFT:组相对隐式微调集成 GRPO、DPO 与 UNA

机器学习 2026-05-15 v5 计算与语言

摘要

本文探讨了奖励匹配是否为 LLM 在策略梯度 RL 中基于奖励最大化方法的可行替代方案。提出组相对隐式微调 (GIFT) 方法,结合 GRPO 风格的组采样、DPO 风格的隐式奖励以及 UNA 风格的显式优势与隐式优势之间的均方误差。通过应用 Z -score 标准化,消去 DPO 隐式奖励中不可计算的分区函数 Z(x)Z(x),并消除 KL 系数 β\beta 于 RLHF 和 RLVR 目标中的作用。我们对 LGIFT\mathcal{L}_{\text{GIFT}} 的 population minimizers 进行闭式刻画:其恰好与 GRPO/RLHF 解族 πβ(yx)πref(yx)e1βrϕ(x,y)\pi^{*}_{\beta}(y|x)\propto\pi_{\text{ref}}(y|x)e^{\frac{1}{\beta}r_{\phi}(x,y)} 完全一致,其中 KL 系数 β(x)=σϕ(x)σ^θ(x)\beta(x)=\frac{\sigma_\phi(x)}{\hat{\sigma}_\theta(x)} 取决于提示且由奖励分布方差决定。因此,GIFT 解决了与 GRPO 相同的参数化策略族的问题,取代了 GRPO 外部调谐的标量 β\beta 为提示自适应的 β(x)\beta(x),由奖励分布匹配端ogenously 优化。实验在 7B-32B 参数规模的模型上表明,GIFT 收敛速度快于 GRPO、DAPO 和 GSPO,且在 RLVR (GSM8K、MATH、AIME) 上过拟合更少,在 RLHF (AlpacaEval、Arena-Hard) 上产生更高的 length-controlled 胜率。所有证明与详细背景均延迟至附录。

关键词

引用

@article{arxiv.2510.23868,
  title  = {GIFT: Group-Relative Implicit Fine-Tuning Integrates GRPO with DPO and UNA},
  author = {Zhichao Wang},
  journal= {arXiv preprint arXiv:2510.23868},
  year   = {2026}
}