中文

基于策略蒸馏的多种面貌:陷阱、机制与修复

人工智能 2026-05-26 v2

摘要

基于策略蒸馏 (OPD) 和基于策略自蒸馏 (OPSD) 已成为大型语言模型的有前景的后训练方法,提供了来自模型自身策略所抽样轨迹上稠密的 token 级监督。然而,现有结果关于其有效性仍不一致:尽管 OP(S)D 在系统提示和知识内化方面显示出前景,但近期研究也报告了不稳定和性能下降。本文我们进行了 OPD 和 OPSD 何时有效、何时失败以及为何会失败的全面实证研究。我们发现,关于数学推理的 OPD 对教师选择和损失函数形式高度敏感,而 OPSD 在我们测试的设置中因缺乏实例特定的特权信息 (PI) 而失败。相比之下,当 PI 表示共享的潜在规则时(如系统提示或对齐偏好),OPSD 才有效。我们识别出三个失败机制:(1) 教师与学生之间因以学生生成的前缀为条件而产生的分布不匹配,(2) 来自有偏 TopK reverse-KL 梯度的优化不稳定,(3) OPSD 特有的局限性在于,学生学习的是一个没有 PI 的政策,这会将 PI 条件化的教师聚合起来,当 PI 为实例特定时,这就不够了。我们进一步表明,stop-gradient TopK 目标、RLVR 适应的教师以及 SFT 稳定的学生可缓解这些失败。

关键词

引用

@article{arxiv.2605.11182,
  title  = {The Many Faces of On-Policy Distillation: Pitfalls, Mechanisms, and Fixes},
  author = {Siqi Zhu and Xuyan Ye and Hongyu Lu and Weiye Shi and Ge Liu},
  journal= {arXiv preprint arXiv:2605.11182},
  year   = {2026}
}