中文

重新审视策略内蒸馏:经验失败模式与简单修复

量子物理 2026-03-31 v2 物理与社会

摘要

策略内蒸馏(OPD)正日益用于大语言模型(LLM)的后训练,因为它可以利用教师模型为学生rollout提供密集的监督信号。然而,标准实现通常将分布匹配简化为采样token的对数比,这可能使学习信号在学生前缀偏离教师典型支持的较长rollout上变得脆弱。我们从理论和实现两个角度重新审视这一公式。理论上,token级OPD相对于序列级逆KL最小化是有偏的,但具有显著更紧的最坏情况方差界;受控的合成研究进一步表明,更强的未来奖励耦合会增加梯度方差并使训练不稳定。在经验上,我们识别出采样token OPD的三种失败模式:token级监督不平衡、教师对学生生成前缀的指导不可靠、以及tokenizer或特殊token不匹配。这些发现促使了教师Top-K局部支持匹配——一种截断逆KL目标,在每个前缀处比较教师和学生分布在教师支持token集上的分布——以及Top-p rollout采样和特殊token掩码。在涵盖智能体(agentic)和推理场景的单任务推理和多任务基准中,该目标改善了优化稳定性,相比标准采样token OPD基线实现了+19.8%的性能提升,为更稳定的策略内蒸馏提供了实用方案。

关键词

引用

@article{arxiv.2603.25563,
  title  = {Stochastic Multipath Routing for High-Throughput Entanglement Distribution in Quantum Repeater Networks},
  author = {Ankit Mishra and Kang Hao Cheong},
  journal= {arXiv preprint arXiv:2603.25563},
  year   = {2026}
}

备注

11 pages, 6 figures in main text, 3 figures in SM