面向大型语言模型蒸馏的多粒度语义修订
计算与语言
2024-07-16 v1
摘要
知识蒸馏在压缩大型语言模型(LLMs)方面发挥着关键作用,这有助于受大型教师模型指导下构建小规模的学生模型。然而,现有的LLM蒸馏方法过于依赖于学生生成的输出,这可能引入生成误差并误导蒸馏过程。此外,之前方法引入的蒸馏损失函数在面对LLM输出的复杂分布时,难以对齐最具信息性的部分。为此,我们提出了一种用于LLM蒸馏的多粒度语义修订方法。在序列层面,我们提出了序列纠正与重生成(SCRG)策略。SCRG首先计算教师与学生之间的语义认知差异,以检测错误标记,然后用教师生成的标记进行纠正,并重新生成序列以减少生成误差并增强生成多样性。在标记层面,我们设计了分布自适应裁剪KL(DAC-KL)损失作为蒸馏目标函数。DAC-KL损失利用可学习的子网络自适应提取教师输出中语义稠密区域,避免蒸馏过程中冗余信息的干扰。最后,在片段层面,我们利用序列的片段先验计算片段内的概率相关性,并约束教师与学生的概率相关性保持一致,从而进一步增强语义信息的传递。广泛的实验在参数范围从0.1B到13B的不同模型家族中表明,我们的方法优于现有方法。
引用
@article{arxiv.2407.10068,
title = {Multi-Granularity Semantic Revision for Large Language Model Distillation},
author = {Xiaoyu Liu and Yun Zhang and Wei Li and Simiao Li and Xudong Huang and Hanting Chen and Yehui Tang and Jie Hu and Zhiwei Xiong and Yunhe Wang},
journal= {arXiv preprint arXiv:2407.10068},
year = {2024}
}