恢复最佳点:用于LLM推理的通过率加权自蒸馏
机器学习
2026-05-28 v1 人工智能
摘要
自蒸馏策略优化通过利用模型自身的反馈条件预测作为自教师,为基于大语言模型的强化学习提供密集的令牌级信用分配。然而,与GRPO不同——其群体相对优势自然地将学习集中在中等难度问题的“最佳点”上——SDPO基于KL散度的优势缺乏隐式的难度感知。我们通过GRPO优势归一化的视角分析了这一差距。将可学习性框架扩展到归一化奖励,我们表明归一化吸收了方差项p(1-p),使各问题间的领先阶可学习性相等,并留下√[p(1-p)]作为每个问题梯度中唯一的残差缩放因子。这一分析产生了一个简单的处方:用[ˆp(1-ˆp)]^{1/2}加权每个问题的SDPO损失,从而得到SC-SDPO,即SDPO的一个尺度一致变体。所提出的权重是在策略rollout过程中通过批量自适应归一化以零成本副产品获得的,这引入了一个隐式课程,动态跟踪模型不断发展的能力。在科学推理和工具使用基准上的实验表明,SC-SDPO持续优于SDPO,在Qwen3-8B上获得了+3.2/+4.3(mean@16/maj@16)的提升,在OLMo-3-7B上获得了+1.8/+3.0的提升,同时在整个优化过程中保持了稳定的训练动态。
引用
@article{arxiv.2605.27765,
title = {Restoring the Sweet Spot: Pass-Rate Weighted Self-Distillation for LLM Reasoning},
author = {Zehao Liu and Yuanpu Cao and Jinghui Chen and Vasant G. Honavar},
journal= {arXiv preprint arXiv:2605.27765},
year = {2026}
}
备注
18 pages, 8 figures