中文

基于中间表示对比蒸馏的语言模型压缩

计算与语言 2020-09-30 v1 机器学习

摘要

现有的语言模型压缩方法大多使用简单的 L2 损失,将大型 BERT 模型中间表示中的知识蒸馏至较小的模型。尽管被广泛使用,该目标在设计上假设隐藏表示的所有维度相互独立,未能捕捉教师网络中间层中重要的结构知识。为获得更好的蒸馏效能,我们提出中间表示对比蒸馏(CoDIR),一种原则性的知识蒸馏框架,其中学生通过对比目标经由教师的中间层蒸馏知识。通过学习从大量负样本中区分正样本,CoDIR 促进学生利用教师隐藏层中的丰富信息。CoDIR 可轻易应用于预训练与微调阶段大规模语言模型的压缩,并在 GLUE 基准上取得优异性能,优于最先进的压缩方法。

关键词

引用

@article{arxiv.2009.14167,
  title  = {Contrastive Distillation on Intermediate Representations for Language Model Compression},
  author = {Siqi Sun and Zhe Gan and Yu Cheng and Yuwei Fang and Shuohang Wang and Jingjing Liu},
  journal= {arXiv preprint arXiv:2009.14167},
  year   = {2020}
}

备注

Accepted by EMNLP 2020