面向任务无关BERT压缩的权重继承蒸馏
计算与语言
2024-03-21 v2 机器学习
摘要
知识蒸馏(KD)是BERT压缩的主流方法。以往基于KD的方法侧重于设计额外的对齐损失,使学生模型模仿教师模型的行为。这些方法以间接方式迁移知识。本文中,我们提出一种新颖的权重继承蒸馏(WID),直接从教师模型迁移知识。WID不需要任何额外的对齐损失,并通过继承权重训练紧凑的学生模型,展示了知识蒸馏的新视角。具体而言,我们将行压缩器与列压缩器设计为映射,随后通过结构重参数化压缩权重。在GLUE与SQuAD基准上的实验结果表明,WID优于以往最先进的基于KD的基线。进一步分析表明,WID无需任何关于注意力分布的对齐损失也能从教师模型学习注意力模式。代码可见于 https://github.com/wutaiqiang/WID-NAACL2024。
引用
@article{arxiv.2305.09098,
title = {Weight-Inherited Distillation for Task-Agnostic BERT Compression},
author = {Taiqiang Wu and Cheng Hou and Shanshan Lao and Jiayi Li and Ngai Wong and Zhe Zhao and Yujiu Yang},
journal= {arXiv preprint arXiv:2305.09098},
year = {2024}
}
备注
9 pages, 4 figures, NAACL2024 findings