中文

Linformer:具有线性复杂度的自注意力机制

机器学习 2020-06-16 v3 机器学习

摘要

大型Transformer模型在许多自然语言处理应用中取得了最先进结果,表现出非凡的成功。然而,对于长序列,训练和部署这些模型可能成本高昂,因为Transformer的标准自注意力机制在序列长度上使用了O(n2)O(n^2)的时间和空间。本文中,我们证明自注意力机制可由低秩矩阵近似。我们进一步利用这一发现提出一种新的自注意力机制,将整体自注意力复杂度在时间和空间上从O(n2)O(n^2)降低到O(n)O(n)。所得的线性Transformer,即Linformer,性能与标准Transformer模型相当,同时具有更高的内存和时间效率。

关键词

引用

@article{arxiv.2006.04768,
  title  = {Linformer: Self-Attention with Linear Complexity},
  author = {Sinong Wang and Belinda Z. Li and Madian Khabsa and Han Fang and Hao Ma},
  journal= {arXiv preprint arXiv:2006.04768},
  year   = {2020}
}