中文

CoDistill-GRPO:一种高效组相对策略优化的协助蒸馏配方

机器学习 2026-05-12 v1 应用统计 机器学习

摘要

组相对策略优化(GRPO)已成为提高语言模型推理能力的强大算法,但常常因稀疏奖励而难以改进小模型。现有工作通过利用更大模型——要么提供 rollout 提示,要么通过知识蒸馏(KD)提供稠密奖励信号——来缓解此问题。然而,这假设存在此类 oracle,而训练一个 oracle 显著增加总体训练时间。在本文中,我们提出 CoDistill-GRPO,这是一个协助蒸馏算法,同时训练大模型和小模型,通过最大化精心设计的 GRPO 目标实现。两种模型彼此学习:小模型使用基于 on-policy 的 KD 奖励从大模型分布中学习,而大模型则使用小模型生成的 rollout 经过重要性重加权进行更新,从而降低 rollout 生成的计算开销。我们展示,CoDistill-GRPO 在 Qwen 和 Llama 模型上的数学基准测试中显著优于标准 GRPO。具体而言,对于 Qwen2.5-Math-1.5B,我们在 base 模型上实现了超过 11.6 个百分点的准确率提升,并在 Minerva 数据集上比 GRPO 额外提升 6.0 个百分点。有趣的是,较大模型(Qwen2.5-Math-7B)使用 CoDistill-GRPO 几乎与标准 GRPO 性能相当,尽管是基于小模型的 rollout 训练。这凸显了 CoDistill-GRPO 作为 GRPO 的一种成本效益替代方案,大约可实现 18% 的加速,这可能是独立的兴趣。

关键词

引用

@article{arxiv.2605.08873,
  title  = {CoDistill-GRPO: A Co-Distillation Recipe for Efficient Group Relative Policy Optimization},
  author = {Soo Min Kwon and Ziteng Sun and Ananda Theertha Suresh and Himanshu Jain and Sanjiv Kumar},
  journal= {arXiv preprint arXiv:2605.08873},
  year   = {2026}
}