大语言模型在线策略蒸馏综述
机器学习
2026-05-19 v3 计算与语言
摘要
随着大语言模型(LLMs)在能力和成本上持续增长,将前沿能力转移到更小、可部署的学生模型中已成为一个核心的工程问题,而知识蒸馏仍然是实现这种迁移的主导技术。工业流水线中 prevailing 的方法——对教师生成文本的静态模仿——存在一种结构性弱点,且随着任务变得更长、更具推理性,这种弱点会变得更加严重。由于学生模型在训练时使用的是无瑕疵的教师前缀,但在推理时必须自行生成,小的错误往往会累积成其很少被训练去恢复的轨迹,由此产生的暴露偏差已被证明大致随序列长度的平方增长。在线策略蒸馏(OPD)围绕这一观察重新组织了训练循环,让教师对学生实际产生的内容提供反馈,旨在将复合项的减少推向线性,并将蒸馏重新框定为迭代修正过程,而非单次模仿。由此产生的文献沿着散度设计、奖励引导优化和自对弈三个方向扩展,但相关贡献仍然分散在知识蒸馏、RLHF 和模仿学习社区中,缺乏统一的梳理。本综述提供了这样的梳理。我们将 OPD 形式化为对学生采样轨迹上的 -散度最小化,沿三个设计轴(优化目标、信号来源以及实践中如何稳定训练)组织该领域,并综合了成功条件、反复出现的失败模式以及 OPD 与 KL 约束强化学习之间的联系。我们以该综合分析中涌现的开放性问题作为结尾,包括蒸馏缩放律、不确定性感知反馈、智能体蒸馏,以及知识蒸馏与强化学习之间日益加重的重叠。
引用
@article{arxiv.2604.00626,
title = {A Survey of On-Policy Distillation for Large Language Models},
author = {Mingyang Song and Mao Zheng},
journal= {arXiv preprint arXiv:2604.00626},
year = {2026}
}
备注
Ongoing Work