每个专家都很重要:面向混合专家语言模型的有效知识蒸馏
计算与语言
2025-02-19 v1 人工智能
机器学习
摘要
随着混合专家(MoE)的出现,高效扩展模型规模加速了近年来大型语言模型的发展。然而,其高内存需求阻止了它们在资源受限环境中的使用。尽管知识蒸馏(KD)已被证明是模型压缩的有效方法,但其在 MoE 教师模型上的应用仍未被充分探索。通过我们的研究,我们发现 MoE 模型中未激活的专家拥有对学生模型有益的有价值知识。我们进一步证明现有的 KD 方法在压缩 MoE 模型方面并非最优,因为它们未能有效利用这些知识。为了解决这一问题,我们首次提出了两种直观的 MoE 专用 KD 方法:知识增强(KA)和学生感知路由器(SAR),两者都旨在从所有专家中有效提取知识。具体而言,KA 通过多次采样专家来增强知识,而 SAR 使用所有专家并通过路由器训练调整专家权重以提供最优知识。大量实验表明,我们的方法优于传统的 KD 方法,证明了它们在 MoE 教师模型上的有效性。
引用
@article{arxiv.2502.12947,
title = {Every Expert Matters: Towards Effective Knowledge Distillation for Mixture-of-Experts Language Models},
author = {Gyeongman Kim and Gyouk Chu and Eunho Yang},
journal= {arXiv preprint arXiv:2502.12947},
year = {2025}
}