中文

超越 GRPO 与在策略内蒸馏:语言模型后训练的稀疏-稠密奖励原则

机器学习 2026-05-21 v4 人工智能

摘要

在标签化可验证训练数据受限的场景中,每个被检查的示例应被分配到模型与奖励密度最具信息性的地方。我们识别了一个控制这种分配的奖励密度原则:稀疏序列级奖励最适用于能够探索并发现更好行为的模型,而稠密的 token 级教师监督更适用于将该行为压缩到较小部署模型中的情况。该原则导致一个简单的分配规则:在最强可用教师上稀疏地使用稀缺标签数据,然后将奖励导向的行为作为稠密监督向下传递。我们通过四阶段工作流程——教师 RL、forward-KL warmup、on-policy 蒸馏、可选 post-bridge 学生 RL——对该规则进行评估,针对可验证的数学问题使用 Qwen3 和 Llama 模型。对于固定 Qwen3-1.7B 部署学生规模,经 RL 改进的 8B 教师通过稠密桥接蒸馏的模型在同一学生上 outperform direct GRPO(在 MATH 上 79.3%79.3\% vs. 75.9%75.9\%;在 AIME~2024 上 25.2%25.2\% vs. 19.8%19.8\%,avg@16),而来自该教师但 \emph{未经} RL 的迁移则表现较差。组件消融实验确认每个阶段都至关重要:将 RL 改进的教师替换为原始教师损失 7.87.8 分 MATH 得分,移除 forward-KL warmup 损失 1.71.7 分,移除 on-policy 蒸馏损失 3.33.3 分。教师质量排序——raw-teacher transfer << direct GRPO << RL-teacher transfer——在使用 Llama-3.1-8B-Instruct 与 Llama-3.3-70B-Instruct 教师的实验中得到复制。运营中的关键教训是:避免将稀缺标签数据用于最不准备好的策略:使用稀疏奖励进行教师侧发现,使用稠密传递进行学生压缩,仅在桥梁构建后才对学生侧使用稀疏奖励。

关键词

引用

@article{arxiv.2605.12483,
  title  = {Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training},
  author = {Yuanda Xu and Hejian Sang and Zhengze Zhou and Ran He and Zhipeng Wang and Alborz Geramifard},
  journal= {arXiv preprint arXiv:2605.12483},
  year   = {2026}
}