探索注意力图复用以实现高效 Transformer 神经网络
人工智能
2023-01-31 v1 信号处理
摘要
基于 Transformer 的深度神经网络因建模长程依赖的强大能力,在各种序列应用中取得巨大成功。Transformer 的关键模块是自注意力(SA),其从整个序列中提取特征而不受位置间距离影响。尽管 SA 助力 Transformer 在长程任务上表现尤为出色,SA 所需的计算与内存复杂度随输入序列长度呈二次增长。近来,注意力图复用——将多个 SA 层分组共享一个注意力图——被提出并为语音识别模型实现了显著加速。本文中,我们提供关于注意力图复用的全面研究,聚焦其加速推理的能力。我们将该方法与其他 SA 压缩技术比较,并针对长序列对其优势进行分解分析。我们通过测量 CPU 与 GPU 平台上的延迟来证明注意力图复用的有效性。
引用
@article{arxiv.2301.12444,
title = {Exploring Attention Map Reuse for Efficient Transformer Neural Networks},
author = {Kyuhong Shim and Jungwook Choi and Wonyong Sung},
journal= {arXiv preprint arXiv:2301.12444},
year = {2023}
}