中文

高效 Transformer 知识蒸馏:一项性能综述

计算与语言 2023-11-27 v1 机器学习

摘要

随着预训练 transformer 语言模型持续取得最先进性能,自然语言处理社区已推动模型压缩与高效注意力机制的进展,以应对高计算需求和受限的输入序列长度。尽管有这些各自独立的努力,尚未有研究探讨这两个领域的交叉。在本文中,我们提供了通过知识蒸馏对高效注意力 transformer 进行模型压缩的评估。我们给出了最先进高效注意力架构压缩的成本-性能权衡,以及相较于其全注意力对应模型所获得的性能增益。此外,我们引入了一个新的长上下文命名实体识别数据集 GONERD,用于在长序列上训练和测试 NER 模型性能。我们发现,蒸馏的高效注意力 transformer 能保留显著的原始模型性能,在短上下文任务(GLUE、SQUAD、CoNLL-2003)上保留高达 98.6%,在长上下文问答任务(HotpotQA、TriviaQA)上保留高达 94.6%,在长上下文命名实体识别(GONERD)上保留高达 98.8%,同时将推理时间减少多达 57.8%。我们发现,对于大多数模型的大多数任务,执行知识蒸馏是一种以低成本产出高性能高效注意力模型的有效方法。

关键词

引用

@article{arxiv.2311.13657,
  title  = {Efficient Transformer Knowledge Distillation: A Performance Review},
  author = {Nathan Brown and Ashton Williamson and Tahj Anderson and Logan Lawrence},
  journal= {arXiv preprint arXiv:2311.13657},
  year   = {2023}
}

备注

Accepted to EMNLP 2023. 12 pages, 1 figure, 11 tables. Models and data available at https://huggingface.co/giant-oak