中文

用于高效思维链蒸馏的课程学习:基于结构感知掩蔽与GRPO

机器学习 2026-03-06 v3 人工智能

摘要

将思维链推理从大型语言模型蒸馏到紧凑的学生模型面临一个根本性挑战:教师的推理过程对于较小的模型来说往往过于冗长,难以忠实复现。现有方法要么将推理压缩为单一步骤,从而失去了使CoT有价值的可解释性。我们提出了一个三阶段课程学习框架,通过渐进式技能习得来解决这种能力不匹配问题。首先,我们通过掩蔽打乱重建建立结构理解。其次,我们在掩蔽补全任务上应用组相对策略优化,使模型能够自行发现准确性与简洁性之间的平衡。第三,我们识别出持续存在的失败案例,并通过有针对性的重写(同样使用GRPO优化)引导学生内化教师知识。在GSM8K上的实验表明,我们的方法使Qwen2.5-3B-Base在将输出长度减少27.4%的同时,准确率提升了11.29%,超越了指令微调变体及先前的蒸馏方法。

关键词

引用

@article{arxiv.2602.17686,
  title  = {Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO},
  author = {Bowen Yu and Maolin Wang and Sheng Zhang and Binhao Wang and Yi Wen and Jingtong Gao and Bowen Liu and Zimo Zhao and Wanyu Wang and Xiangyu Zhao},
  journal= {arXiv preprint arXiv:2602.17686},
  year   = {2026}
}

备注

22 pages, 12 figures