中文

面向 Transformer 语言模型压缩的任务无关蒸馏方法比较分析

计算与语言 2023-10-16 v1 人工智能

摘要

大语言模型已成为现代 NLP 的重要组成部分,在多种任务上取得了最先进的性能。然而,由于其昂贵的推理成本,它们在现实部署中往往效率低下。知识蒸馏是一种在保留大部分有效性的同时提升效率的有前景的技术。在本文中,我们复现、比较并分析了几种具有代表性的 Transformer 语言模型任务无关(通用)蒸馏方法。我们的研究对象包括输出分布(OD)迁移、采用多种层映射策略的隐状态(HS)迁移,以及基于 MiniLMv2 的多头注意力(MHA)迁移。通过大量实验,我们研究了每种方法在单语(英语)和多语设置下针对不同学生架构的有效性。总体而言,我们表明基于 MiniLMv2 的 MHA 迁移通常是蒸馏的最佳选择,并解释了其成功背后的潜在原因。此外,我们表明 HS 迁移仍是一个有竞争力的基线,尤其在精细的层映射策略下,而 OD 迁移始终落后于其他方法。本研究的发现帮助我们为延迟敏感型应用部署了高效且有效的学生模型。

关键词

引用

@article{arxiv.2310.08797,
  title  = {A Comparative Analysis of Task-Agnostic Distillation Methods for Compressing Transformer Language Models},
  author = {Takuma Udagawa and Aashka Trivedi and Michele Merler and Bishwaranjan Bhattacharjee},
  journal= {arXiv preprint arXiv:2310.08797},
  year   = {2023}
}

备注

Accepted to EMNLP 2023 Industry Track