中文

PACED:在学生能力边缘的蒸馏与自蒸馏

人工智能 2026-04-13 v3 机器学习

摘要

标准大语言模型蒸馏将所有训练问题视为等价——在学生已掌握或尚未解决的问题上浪费计算资源。我们实证表明,这种效率低下在梯度层面上具有明确的标志:跨问题的梯度信噪比 (SNR) 对学生通过率呈钟形曲线,在两个极端处即坍缩。我们提出 PACED 方法,依据学生经验性通过率 pp 对每个问题赋予权重 w(p)=p(1p)w(p) = p(1-p)——将训练集中于发展区的区域。这仅需学生 rollout,无需架构修改,也无需调节超参数。我们证明 Beta 核 w(p)=pα(1p)βw(p) = p^\alpha(1-p)^\beta 是源于 SNR 边界坍缩结构所产生的首阶最优权重族,且在模型误指定下具有鲁棒性(最坏情况下的效率损失为 O(δ2)O(\delta^2))。在 Qwen3、Qwen2.5 和 Llama-3 系列模型中,PACED 在 MATH-500、AIME~2024 和 AIME~2025 上的实验结果达到新纪录,较未加权蒸馏提升最高可达 +8.2\mathbf{+8.2},较强大的 AKL 基线提升最高可达 +3.6\mathbf{+3.6},蒸馏和自蒸馏中的遗忘率分别降至 1.4%\mathbf{1.4\%}0.6%\mathbf{0.6\%}。采用两阶段的前向后向 KL 计划进一步将提升推进至 +5.8\mathbf{+5.8}

关键词

引用

@article{arxiv.2603.11178,
  title  = {PACED: Distillation and On-Policy Self-Distillation at the Frontier of Student Competence},
  author = {Yuanda Xu and Hejian Sang and Zhengze Zhou and Ran He and Zhipeng Wang},
  journal= {arXiv preprint arXiv:2603.11178},
  year   = {2026}
}