解码 On-Policy 蒸馏中的 Rock 标记:支柱还是绊脚石?
计算与语言
2026-05-12 v1 人工智能
摘要
虽然近期工作在可验证奖励的强化学习 (RLVR) 中表明,少数关键标记在不成比例地驱动推理方面具有重要作用,但对 On-Policy 蒸馏 (OPD) 中标记水平的理解仍然基本未探讨。本文我们关注高损失标记——这是一种标记类型,在 OPD 的 per-token KL 目标下,作为学生-教师不匹配的最直接信号,应该随着训练收敛而逐渐减少;然而,我们的经验分析显示情况并非如此。即便 OPD 训练到达看似饱和的阶段,仍有相当比例的标记持续表现出持续的高损失;我们称这些标记为 Rock 标记,可占生成输出中最多 18% 的标记。我们的调查揭示了两个令人惊讶的悖论:首先,尽管 Rock 标记的高出现频率为总梯度范数提供了不成比例的大部分贡献,但 Rock 标记本身在训练期间仍保持不变,抵抗教师驱动的纠正。其次,通过因果干预,我们发现这些标记对模型实际推理性能的实际贡献微乎其微。这表明大量的优化带宽被用于处理结构和话语残差,而这些残差学生模型无法或无需内化。通过解构这些动态,我们表明,策略性地绕过这些“绊脚石”可以显著简化对齐过程,挑战了均匀标记加权的必要性,为大规模模型蒸馏提供了更高效的范式。
引用
@article{arxiv.2605.09253,
title = {Cornerstones or Stumbling Blocks? Deciphering the Rock Tokens in On-Policy Distillation},
author = {Yuxuan Jiang and Runchao Li and Shubhashis Roy Dipta and Dawei Li and Zhao Yang},
journal= {arXiv preprint arXiv:2605.09253},
year = {2026}
}