中文

EL-Attention:用于生成的记忆高效无损注意力

计算与语言 2021-06-15 v2 机器学习

摘要

带有多头注意力的 Transformer 模型需要缓存中间结果以在生成任务中高效推理。然而,缓存带来了新的与内存相关的开销,并阻碍了利用更大批量以实现更快速度。我们提出记忆高效无损注意力(称为 EL-attention)以解决此问题。它避免了构建多头键和值的繁重操作,因此无需为它们缓存。EL-attention 通过扩展查询同时保持键和值共享,构建注意力结果的集成。它产生与多头注意力相同的结果,但占用更少 GPU 内存且推理速度更快。我们在 Transformer、BART 和 GPT-2 上针对摘要和问答生成任务进行了大量实验。结果表明,EL-attention 在不损失精度的情况下将现有模型加速 1.6 倍至 5.3 倍。

关键词

引用

@article{arxiv.2105.04779,
  title  = {EL-Attention: Memory Efficient Lossless Attention for Generation},
  author = {Yu Yan and Jiusheng Chen and Weizhen Qi and Nikhil Bhendawade and Yeyun Gong and Nan Duan and Ruofei Zhang},
  journal= {arXiv preprint arXiv:2105.04779},
  year   = {2021}
}

备注

ICML 2021. Version 2: add pseudocode