深度神经网络注意力机制中基于数据信息的全局稀疏化
计算与语言
2024-05-20 v3
摘要
注意力机制在自然语言处理(NLP)的神经革命中起着关键作用。随着基于注意力的模型的发展,已开发出多种剪枝技术来识别并利用稀疏性,使这些模型更高效。大多数工作集中于硬编码注意力模式或基于训练数据剪枝注意力权重。我们提出注意力剪枝(AP, Attention Pruning),一种观察固定数据集中的注意力模式并生成全局稀疏掩码的框架。AP在语言建模中节省90%的注意力计算,在机器翻译和GLUE任务中节省约50%,同时保持结果质量。我们的方法揭示了自注意力与交叉注意力模式之间的重要区别,为未来NLP研究提供指导。我们的框架可降低任何基于注意力的模型的延迟与内存需求,有助于为现有或新的NLP应用开发改进模型。我们使用Triton GPU内核在编码器与自回归Transformer模型上证明了这一点,并在 https://github.com/irugina/AP 公开了代码。
引用
@article{arxiv.2012.02030,
title = {Data-Informed Global Sparseness in Attention Mechanisms for Deep Neural Networks},
author = {Ileana Rugina and Rumen Dangovski and Li Jing and Preslav Nakov and Marin Soljačić},
journal= {arXiv preprint arXiv:2012.02030},
year = {2024}
}
备注
Presented at LREC-COLING 2024: 12 pages, 4 figures, 11 tables