将预训练语言模型跨架构蒸馏为矩阵嵌入
计算与语言
2022-07-29 v2 机器学习
摘要
大型预训练语言模型(PreLMs)正在彻底改变所有基准上的自然语言处理。然而,其庞大的规模对于小型实验室或移动设备上的部署而言 prohibitive。剪枝与蒸馏等方法减小了模型规模,但通常保留相同的模型架构。相比之下,我们探索将 PreLMs 蒸馏为一种不同的、更高效的架构——词的连续乘法(CMOW),其将每个词嵌入为矩阵并利用矩阵乘法来编码序列。我们扩展了 CMOW 架构及其 CMOW/CBOW-Hybrid 变体,加入双向组件以增强表达能力、加入逐词元表示以在预训练期间进行通用(任务无关)蒸馏,以及加入双序列编码方案以便利句子对上的下游任务,如句子相似度与自然语言推理。我们基于矩阵的双向 CMOW/CBOW-Hybrid 模型在问题相似度与识别文本蕴含上可与 DistilBERT 竞争,但仅使用其一半数量的参数且推理速度三倍于后者。在 GLUE 基准的所有任务中,除情感分析任务 SST-2 与语言可接受性任务 CoLA 外,我们匹配或超越了 ELMo 的分数。然而,相较于先前的跨架构蒸馏方法,我们在检测语言可接受性上展示了分数的翻倍。这表明基于矩阵的嵌入可用于将大型 PreLM 蒸馏为具有竞争力的模型,并激励该方向的进一步研究。
引用
@article{arxiv.2109.08449,
title = {General Cross-Architecture Distillation of Pretrained Language Models into Matrix Embeddings},
author = {Lukas Galke and Isabelle Cuber and Christoph Meyer and Henrik Ferdinand Nölscher and Angelina Sonderecker and Ansgar Scherp},
journal= {arXiv preprint arXiv:2109.08449},
year = {2022}
}
备注
8 pages as accepted for WCCI/IJCNN 2022 + 8 pages supplementary material