PACED:在学生能力边缘的蒸馏与自蒸馏
人工智能
2026-04-13 v3 机器学习
摘要
标准大语言模型蒸馏将所有训练问题视为等价——在学生已掌握或尚未解决的问题上浪费计算资源。我们实证表明,这种效率低下在梯度层面上具有明确的标志:跨问题的梯度信噪比 (SNR) 对学生通过率呈钟形曲线,在两个极端处即坍缩。我们提出 PACED 方法,依据学生经验性通过率 对每个问题赋予权重 ——将训练集中于发展区的区域。这仅需学生 rollout,无需架构修改,也无需调节超参数。我们证明 Beta 核 是源于 SNR 边界坍缩结构所产生的首阶最优权重族,且在模型误指定下具有鲁棒性(最坏情况下的效率损失为 )。在 Qwen3、Qwen2.5 和 Llama-3 系列模型中,PACED 在 MATH-500、AIME~2024 和 AIME~2025 上的实验结果达到新纪录,较未加权蒸馏提升最高可达 ,较强大的 AKL 基线提升最高可达 ,蒸馏和自蒸馏中的遗忘率分别降至 和 。采用两阶段的前向后向 KL 计划进一步将提升推进至 。
引用
@article{arxiv.2603.11178,
title = {PACED: Distillation and On-Policy Self-Distillation at the Frontier of Student Competence},
author = {Yuanda Xu and Hejian Sang and Zhengze Zhou and Ran He and Zhipeng Wang},
journal= {arXiv preprint arXiv:2603.11178},
year = {2026}
}