中文

AxFormer:面向更快、更小且更准 NLP 模型的精度驱动 Transformer 近似方法

计算与语言 2022-06-13 v2 人工智能 机器学习

摘要

近年来,Transformer 极大推动了自然语言处理(NLP)领域的最先进水平,但其计算与存储需求非常庞大。我们观察到,Transformer 的设计流程(以自监督方式在大型数据集上预训练基础模型,随后针对不同的下游任务进行微调)会产生高度过参数化的任务特定模型,对准确性和推理效率均产生不利影响。我们提出 AxFormer,一个系统性框架,应用精度驱动近似为给定下游任务创建优化后的 Transformer 模型。AxFormer 结合了两项关键优化——精度驱动剪枝与选择性硬注意力。精度驱动剪枝识别并移除微调后 Transformer 中妨碍该下游任务性能的部分。稀疏硬注意力通过消除不相关的词聚合来优化选定层中的注意力块,从而帮助模型仅关注输入的相关部分。实际上,AxFormer 得到的模型不仅更准确,而且更快、更小。我们在 GLUE 和 SQUAD 任务上的实验表明,与常规微调模型相比,AxFormer 模型的准确率最高提升 4.5%,同时速度最高达 2.5 倍、体积最高缩小 3.2 倍。此外,我们证明 AxFormer 可与蒸馏或量化等已有工作结合,以获得进一步的效率提升。

关键词

引用

@article{arxiv.2010.03688,
  title  = {AxFormer: Accuracy-driven Approximation of Transformers for Faster, Smaller and more Accurate NLP Models},
  author = {Amrit Nagarajan and Sanchari Sen and Jacob R. Stevens and Anand Raghunathan},
  journal= {arXiv preprint arXiv:2010.03688},
  year   = {2022}
}

备注

International Joint Conference on Neural Networks (IJCNN) 2022