中文

不要忽略尾部:解耦主导概率以提高语言模型蒸馏效率

计算与语言 2026-05-11 v3 机器学习

摘要

语言模型蒸馏中使用的核心学习信号是学生分布与教师分布之间的标准 Kullback-Leibler (KL) 散度。传统的 KL 散度往往被教师分布中概率最高的下一个标记所主导,即教师的模式,从而削弱了那些虽不太可能但可能具有信息量的输出分布组件的影响。我们提出了一种新的尾部感知散度,将教师模型预测的前 K 大概率与较低概率预测的贡献进行解耦,同时保持与 KL 散度相同的计算配置。我们的解耦方法减少了教师模式的影响,从而增加了分布尾部的贡献。实验结果表明,我们的修改蒸馏方法在各种数据集上对解码器模型进行预训练和监督蒸馏均能实现具有竞争力的性能。此外,蒸馏过程高效,可以在较小的学术预算下处理大型数据集,无需行业级计算资源。

关键词

引用

@article{arxiv.2602.20816,
  title  = {Don't Ignore the Tail: Decoupling top-K Probabilities for Efficient Language Model Distillation},
  author = {Sayantan Dasgupta and Trevor Cohn and Timothy Baldwin},
  journal= {arXiv preprint arXiv:2602.20816},
  year   = {2026}
}

备注

ICML 2026