前缀教学,后缀消失:强-弱策略蒸馏中的局部教学塌陷
计算与语言
2026-05-26 v2
摘要
策略蒸馏(OPD)通过教师模型的稠密反馈在学生模型的自我 rollout中进行训练。先前文献表明,提供教师反馈后,对完整响应标记序列的监督应单调提高性能。然而,我们在强-弱OPD情境中演示了这一假设在某些情况下可能失败。尽管生成轨迹的后续片段可能仍显示出教师-学生优势,但它们经常缺乏使稠密反馈对学生学习有效 prioritization 所必需的局部对比度。我们称这种失败模式为局部教学塌陷。由此提出的原则是 straightforward 的:监督应集中于教师反馈仍具辨识力的轨迹区域,而非均匀覆盖整个响应。我们通过一种轨迹特定的释放规则来实现这一原则。该规则衡量教师在学生 top-K 候选集上的边际,对该边际在NLTK分词句子片段中进行聚合,并在检测到BIC式向下变化点时截断稠密OPD监督。实验结果表明,在Qwen3模型系列的强-弱蒸馏任务中,采用该释放规则的做法在多个领域内在不同学生规模下均优于标准完整轨迹OPD。此外,与基线蒸馏方法相比,我们的方法在面向域外任务方面更好地保留了模型能力。这一结果表明,有效的强-弱OPD需要不仅评估教师指导的可用性,还要评估其局部效用,从而确保生成的反馈具有可教性。
引用
@article{arxiv.2605.13643,
title = {Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation},
author = {Kaiyuan Liu and Ziyuan Zhuang and Yang Bai and Bing Wang and Rongxiang Weng and Jieping Ye},
journal= {arXiv preprint arXiv:2605.13643},
year = {2026}
}