中间层与标签真的必要吗?一种通用语言模型蒸馏方法
计算与语言
2023-06-13 v1 人工智能
摘要
预训练语言模型的大规模给其在各类设备上的部署带来挑战,压缩这些模型的方法日益受到重视,尤其是知识蒸馏。然而,当前知识蒸馏方法依赖于模型的中间层特征和黄金标签(也称硬标签),通常分别要求对齐的模型架构和足够的标注数据。此外,现有方法通常忽视词表参数。为解决这些问题,我们提出一种通用语言模型蒸馏(GLMD)方法,执行两阶段词预测蒸馏与词表压缩,该方法简洁且出人意料地展现出极强的性能。具体而言,GLMD通过摒弃中间层和黄金标签,消除了模型间维度与结构的约束以及对标注数据集的需求,从而支持更通用的应用场景。同时,基于数据中词频率的长尾分布,GLMD设计了一种通过减小词表规模而非维度的词表压缩策略。实验结果表明,我们的方法在SuperGLUE基准上优于25种最先进方法,平均得分超越最佳方法3%。
引用
@article{arxiv.2306.06625,
title = {Are Intermediate Layers and Labels Really Necessary? A General Language Model Distillation Method},
author = {Shicheng Tan and Weng Lam Tam and Yuanchun Wang and Wenwen Gong and Shu Zhao and Peng Zhang and Jie Tang},
journal= {arXiv preprint arXiv:2306.06625},
year = {2023}
}
备注
Accepted to Findings of ACL2023