中文

MiniDisc:用于语言模型压缩的最小蒸馏调度

计算与语言 2024-01-30 v3 机器学习

摘要

近期研究揭示,当教师模型与学生模型之间存在较大容量差距时,语言模型蒸馏的效果较差,并引入了基于教师助理的蒸馏来弥合差距。作为连接,教师助理的规模和性能对于将知识从教师传递给学生至关重要。然而,现有的基于教师助理的方法在调度最优教师助理之前需要尽可能多的尝试。为此,我们提出一种最小蒸馏调度(MiniDisc),以最少的单次尝试调度最优教师助理。具体而言,受学生性能与教师助理的规模-性能权衡正相关的发现启发,MiniDisc设计了一个λ\lambda-权衡来衡量教师助理的最优性,而无需对学生做试蒸馏。MiniDisc随后可以在三明治框架中以最佳λ\lambda-权衡调度最优教师助理。MiniDisc在GLUE上通过一组广泛的实验进行了评估。实验结果表明,与几种最先进的基线相比,我们的MiniDisc效率更高。我们进一步将MiniDisc应用于具有数十亿参数的语言模型,并展示了其可扩展性。

关键词

引用

@article{arxiv.2205.14570,
  title  = {MiniDisc: Minimal Distillation Schedule for Language Model Compression},
  author = {Chen Zhang and Yang Yang and Qifan Wang and Jiahao Liu and Jingang Wang and Wei Wu and Dawei Song},
  journal= {arXiv preprint arXiv:2205.14570},
  year   = {2024}
}

备注

Accepted to EACL 2024. Code is available at https://github.com/GeneZC/MiniDisc