中文

大型语言模型蒸馏的多粒度语义修订

材料科学 2025-06-09 v1 强关联电子

摘要

知识蒸馏在压缩大型语言模型(LLMs)方面发挥着关键作用,这有助于受大型教师模型指导下构建小规模的学生模型。然而,现有的LLM蒸馏方法过于依赖于学生生成的输出,这可能引入生成误差并误导蒸馏过程。此外,之前方法引入的蒸馏损失函数在面对LLM输出的复杂分布时,难以对齐最具信息性的部分。为此,我们提出了一种用于LLM蒸馏的多粒度语义修订方法。在序列层面,我们提出了序列纠正与重生成(SCRG)策略。SCRG首先计算教师与学生之间的语义认知差异,以检测错误标记,然后用教师生成的标记进行纠正,并重新生成序列以减少生成误差并增强生成多样性。在标记层面,我们设计了分布自适应裁剪KL(DAC-KL)损失作为蒸馏目标函数。DAC-KL损失利用可学习的子网络自适应提取教师输出中语义稠密区域,避免蒸馏过程中冗余信息的干扰。最后,在片段层面,我们利用序列的片段先验计算片段内的概率相关性,并约束教师与学生的概率相关性保持一致,从而进一步增强语义信息的传递。广泛的实验在参数范围从0.1B到13B的不同模型家族中表明,我们的方法优于现有方法。

引用

@article{arxiv.2407.10067,
  title  = {Toward a first-principles theory of rare-earth ions in crystals},
  author = {Y. Lee and Z. Ning and R. Flint and R. J. McQueeney and I. I. Mazin and Liqin Ke},
  journal= {arXiv preprint arXiv:2407.10067},
  year   = {2025}
}

备注

11 pages, 4 figures