中文

并非所有不一致都可学习:基于策略的蒸馏中的 token 可教性

机器学习 2026-05-27 v1

摘要

基于策略的蒸馏(OPD)通过 token 级别的教师监督训练学生模型。近期的选择性 OPD 方法利用 OPD 信号的非均匀性,通过优先处理高熵或高 disagreement 的 token 来提高效果。我们重新审视这一原则,提出关键问题:哪些 token 级别的教师信号实际上是可学习的?使用测量相同语境下教师-学生 KL 减少的固定语境诊断工具,我们表明 raw KL disagreement 是学习价值的粗糙代理。它将可学习的 disagreement(教师将纠正质量分配给学生 top-K 候选者)与不可兼容的 disagreement(教师将质量大多数分配给学生当前支持之外)混为一谈。我们将这种局部兼容性 formalized 为 token 可教性(token teachability),并表明它比 raw KL 更能预测固定语境下的改进。鼓励这一发现,我们提出了基于可教性的 OPD(TA-OPD),一种轻量级的 token 位置选择方法,仅针对 high-teachability 位置应用 OPD loss,而无需奖励模型或验证器。在 Qwen2.5 和 Qwen 3 的教师-学生设置中,TA-OPD 常在仅保留 5% token 的情况下超越完整 token OPD,并优于基于熵和 divergence 的基线方法。我们的结果重新定义选择性 OPD,即从可学习的教师信号中进行选择,而不仅仅是挑选显著的 token。

关键词

引用

@article{arxiv.2605.26844,
  title  = {Not All Disagreement Is Learnable: Token Teachability in On-Policy Distillation},
  author = {Yuanyi Wang and Su Lu and Yanggan Gu and Pengkai Wang and Yifan Yang and Zhaoyi Yan and Congkai Xie and Jianmin Wu and Hongxia Yang},
  journal= {arXiv preprint arXiv:2605.26844},
  year   = {2026}
}