HomoDistil:预训练Transformer的同伦任务无关蒸馏
计算与语言
2023-02-21 v1 机器学习
摘要
知识蒸馏已被证明是一种强大的模型压缩方法,可促进预训练语言模型的实际部署。本文关注任务无关蒸馏,其产生一个紧凑的预训练模型,能以较小的计算代价与内存占用轻松地在各类任务上微调。尽管具有实际益处,任务无关蒸馏仍具挑战性:由于教师模型比学生模型具有显著更大的容量与更强的表征能力,学生很难在海量开放域训练数据上产生与教师相匹配的预测。如此大的预测差异常会削弱知识蒸馏的收益。为应对该挑战,我们提出同伦蒸馏(HomoDistil),一种配备迭代剪枝的新型任务无关蒸馏方法。具体而言,我们从教师模型初始化学生模型,并迭代剪枝学生神经元直至达到目标宽度。该方法在整个蒸馏过程中保持师生预测间的微小差异,从而确保知识迁移的有效性。大量实验表明HomoDistil相较现有基线取得显著提升。
引用
@article{arxiv.2302.09632,
title = {HomoDistil: Homotopic Task-Agnostic Distillation of Pre-trained Transformers},
author = {Chen Liang and Haoming Jiang and Zheng Li and Xianfeng Tang and Bin Yin and Tuo Zhao},
journal= {arXiv preprint arXiv:2302.09632},
year = {2023}
}