中文

MiniALBERT:基于参数高效递归 Transformer 的模型蒸馏

计算与语言 2023-05-02 v2 机器学习

摘要

近年来,预训练语言模型(LM)因在下游应用中的优异表现已成为自然语言处理(NLP)不可或缺的一部分。尽管取得巨大成功,LM 的可用性受限于计算与时间复杂度及其不断增大的规模;该问题被称为“过参数化”。文献中提出了不同策略以缓解这些问题,旨在创建近乎匹配臃肿对应模型性能且性能损失可忽略的高效紧凑模型。该研究领域中最流行的技术之一是模型蒸馏。另一有力但利用不足的技术是跨层参数共享。本工作中,我们结合这两种策略并提出 MiniALBERT,一种将完全参数化 LM(如 BERT)的知识转化为紧凑递归学生模型的技术。此外,我们研究了瓶颈适配器(bottleneck adapter)在递归学生模型逐层适配中的应用,并探索了适配器微调用于紧凑模型微调的有效性。我们在若干通用与生物医学 NLP 任务上测试所提模型以证明其可行性,并与最先进方法及其他现有紧凑模型进行比较。实验所用全部代码见 https://github.com/nlpie-research/MiniALBERT。我们的预训练紧凑模型可从 https://huggingface.co/nlpie 获取。

关键词

引用

@article{arxiv.2210.06425,
  title  = {MiniALBERT: Model Distillation via Parameter-Efficient Recursive Transformers},
  author = {Mohammadmahdi Nouriborji and Omid Rohanian and Samaneh Kouchaki and David A. Clifton},
  journal= {arXiv preprint arXiv:2210.06425},
  year   = {2023}
}