EL-Attention:用于生成的记忆高效无损注意力
计算与语言
2021-06-15 v2 机器学习
摘要
带有多头注意力的 Transformer 模型需要缓存中间结果以在生成任务中高效推理。然而,缓存带来了新的与内存相关的开销,并阻碍了利用更大批量以实现更快速度。我们提出记忆高效无损注意力(称为 EL-attention)以解决此问题。它避免了构建多头键和值的繁重操作,因此无需为它们缓存。EL-attention 通过扩展查询同时保持键和值共享,构建注意力结果的集成。它产生与多头注意力相同的结果,但占用更少 GPU 内存且推理速度更快。我们在 Transformer、BART 和 GPT-2 上针对摘要和问答生成任务进行了大量实验。结果表明,EL-attention 在不损失精度的情况下将现有模型加速 1.6 倍至 5.3 倍。
引用
@article{arxiv.2105.04779,
title = {EL-Attention: Memory Efficient Lossless Attention for Generation},
author = {Yu Yan and Jiusheng Chen and Weizhen Qi and Nikhil Bhendawade and Yeyun Gong and Nan Duan and Ruofei Zhang},
journal= {arXiv preprint arXiv:2105.04779},
year = {2021}
}
备注
ICML 2021. Version 2: add pseudocode