中文

解密按策略蒸馏:哪里有帮助,哪里有害,以及原因

机器学习 2026-05-12 v1 人工智能

摘要

按策略蒸馏为训练推理模型提供稠密的逐 token 监督信号,但目前尚不清楚该信号在何种条件下有益,何种条件下有害。应使用哪位教师模型,若采用自蒸馏,特定上下文应作为监督信号吗?最优选择是否因每个 token 而异?目前解决这些问题通常需要代价高昂的训练运行,其综合绩效指标掩盖了单个 token 级别的动态。我们引入一个无训练诊断框架,以最高分辨率进行运作:逐 token、逐问题、逐教师。我们定义理想的逐节点梯度,即最大化学生成功概率的参数更新。随后开发可扩展的定向滚动算法高效估计此梯度,即便在中间思考链较长时亦可。梯度对齐得分定义为该理想梯度与任何给定蒸馏梯度之间的余弦相似度,用于量化特定配置接近理想信号的程度。在多种自蒸馏设置和外部教师模型中,我们观察到蒸馏指导在错误滚动上的对齐程度显著高于正确滚动——后者者学生已表现良好,教师信号倾向于变得噪声化。进一步发现,最优蒸馏上下文同时取决于学生模型的容量与目标任务,无单一通用有效配置。这些发现促使采用逐任务、逐 token 诊断分析进行蒸馏。

关键词

引用

@article{arxiv.2605.10889,
  title  = {Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why},
  author = {Mohammadreza Armandpour and Fatih Ilhan and David Harrison and Ajay Jaiswal and Duc N. M Hoang and Fartash Faghri and Yizhe Zhang and Minsik Cho and Mehrdad Farajtabar},
  journal= {arXiv preprint arXiv:2605.10889},
  year   = {2026}
}