中文

探索与增强自回归语言模型中知识蒸馏中的分布传递

计算与语言 2024-09-23 v2

摘要

知识蒸馏 (KD) 是一种通过训练较小的学生模型以模仿大型教师模型来压缩大型模型的技术。自回归语言模型中的 KD 成功主要依赖于反向 KL 散度进行模式寻找出发,以及学生生成的输出 (SGO) 来克服暴露偏差。我们的理论分析和实验验证表明,尽管反向 KL 有效地模仿教师分布的某些特征,但它未能捕捉其大多数行为。相反,SGO 增加了计算成本,在学生模型显著小于教师模型时 presents 挑战,尤其是在优化方面。这些限制主要源于教师模型分布不可变,无法适应不同大小的模型。我们引入在线知识蒸馏 (OKD),其中教师网络集成小型在线模块以与学生模型并行训练。该策略消除了按策略采样的必要,仅需在训练期间对教师在线模块的参数进行最小更新,从而允许动态适应学生分布以改进蒸馏。广泛的实验结果表明,OKD 在各种模型架构和规模下均达到或超过领先方法的性能,在 various generation 数据集上实现训练时间缩短最高可达四倍。

关键词

引用

@article{arxiv.2409.12512,
  title  = {Exploring and Enhancing the Transfer of Distribution in Knowledge Distillation for Autoregressive Language Models},
  author = {Jun Rao and Xuebo Liu and Zepeng Lin and Liang Ding and Jing Li and Dacheng Tao and Min Zhang},
  journal= {arXiv preprint arXiv:2409.12512},
  year   = {2024}
}