基于张量分解增强的知识蒸馏的过参数化学生模型
人工智能
2024-11-12 v1
摘要
训练参数的增加使大型预训练模型在各种下游任务中表现出色。然而,这些模型相关的广泛计算需求阻碍了其在社区中的广泛采用。我们聚焦于知识蒸馏(KD),其中紧凑的学生模型被训练以模仿更大的教师模型,从而实现大型模型的知识传递。与大多数先前工作不同,我们在训练过程中扩展学生模型的参数,以从过参数化中受益而不增加推理延迟。具体而言,我们提出了一种张量分解策略,通过将其参数矩阵高效地分解为高维张量,有效地使相对较小的学生模型过参数化。为确保效率,我们进一步引入张量约束损失以对齐学生和教师模型之间的高维张量。全面实验验证了我们的方法在各种KD任务中的显著性能提升,涵盖计算机视觉和自然语言处理领域。我们的代码可在 https://github.com/intell-sci-comput/OPDF 获取。
引用
@article{arxiv.2411.06448,
title = {Over-parameterized Student Model via Tensor Decomposition Boosted Knowledge Distillation},
author = {Yu-Liang Zhan and Zhong-Yi Lu and Hao Sun and Ze-Feng Gao},
journal= {arXiv preprint arXiv:2411.06448},
year = {2024}
}
备注
38th Conference on Neural Information Processing Systems (NeurIPS 2024)