中文

消除语言模型蒸馏中容量鸿沟的诅咒

计算与语言 2023-05-23 v1 机器学习

摘要

预训练语言模型(LMs)在各种下游任务上展现出引人注目的性能,但不幸的是它们需要巨大的推理计算量。知识蒸馏以师生范式找到了将 LMs 压缩为小模型的路径。然而,当教师与学生之间的容量鸿沟较大时,会出现容量鸿沟的诅咒,导致 LM 蒸馏的不足。尽管已有少量研究试图填补这一鸿沟,但该诅咒尚未得到很好解决。在本文中,我们旨在通过在不显著增加推理计算量的前提下扩大学生模型的容量,来消除容量鸿沟的诅咒。受专家混合(MoE)稀疏激活机制的大幅启发,我们提出了极小专家混合(MiniMoE),它向学生模型引入额外参数但几乎不带来额外的推理计算量。在 GLUE 和 CoNLL 上的实验结果表明,容量鸿沟的诅咒在很大程度上被 MiniMoE 的魔力所消除。与一系列有竞争力的基线相比,MiniMoE 还在小 FLOPs 下取得了最先进的性能。在高达 \sim50×\times 的压缩率下,MiniMoE 保留了教师模型约 \sim95\% 的 GLUE 分数。

关键词

引用

@article{arxiv.2305.12129,
  title  = {Lifting the Curse of Capacity Gap in Distilling Language Models},
  author = {Chen Zhang and Yang Yang and Jiahao Liu and Jingang Wang and Yunsen Xian and Benyou Wang and Dawei Song},
  journal= {arXiv preprint arXiv:2305.12129},
  year   = {2023}
}

备注

17 pages, 6 figures, 13 tables, accepted to ACL 2023. Code is available at https://github.com/GeneZC/MiniMoE