Linformer:具有线性复杂度的自注意力机制
机器学习
2020-06-16 v3 机器学习
摘要
大型Transformer模型在许多自然语言处理应用中取得了最先进结果,表现出非凡的成功。然而,对于长序列,训练和部署这些模型可能成本高昂,因为Transformer的标准自注意力机制在序列长度上使用了的时间和空间。本文中,我们证明自注意力机制可由低秩矩阵近似。我们进一步利用这一发现提出一种新的自注意力机制,将整体自注意力复杂度在时间和空间上从降低到。所得的线性Transformer,即Linformer,性能与标准Transformer模型相当,同时具有更高的内存和时间效率。
引用
@article{arxiv.2006.04768,
title = {Linformer: Self-Attention with Linear Complexity},
author = {Sinong Wang and Belinda Z. Li and Madian Khabsa and Han Fang and Hao Ma},
journal= {arXiv preprint arXiv:2006.04768},
year = {2020}
}