中文

稀疏教师亦可蕴含稠密知识

计算与语言 2022-10-18 v2 机器学习

摘要

近期在蒸馏预训练语言模型方面的进展发现,除知识的表达性外,还应考虑学生友好性,以实现真正有知识的教师。基于一项初步研究,我们发现过度参数化的教师会产生具有表达性但学生不友好的知识,因而在整体知识性上受限。为去除导致学生不友好的参数,我们提出一种稀疏教师策略,以每个教师参数的整体知识性得分为指导。该知识性得分本质上是表达性得分与学生友好性得分的插值。其目的是在保留表达性参数的同时去除学生不友好的参数。在 GLUE 基准上的大量实验表明,所提出的稀疏教师可蕴含稠密知识,并与一系列有竞争力的基线相比使学生取得引人注目的性能。

关键词

引用

@article{arxiv.2210.03923,
  title  = {Sparse Teachers Can Be Dense with Knowledge},
  author = {Yi Yang and Chen Zhang and Dawei Song},
  journal= {arXiv preprint arXiv:2210.03923},
  year   = {2022}
}

备注

12 pages, 8 figures, 6 tables, accepted to EMNLP 2022. Code is available at https://github.com/GeneZC/StarK