中文

以改进的线性复杂度自注意力重新审视 Linformer

机器学习 2021-01-26 v1

摘要

尽管诸如谷歌的 BERT 和 OpenAI 的 GPT-3 等 Transformer 模型在许多自然语言处理任务中取得成功,训练和部署这些模型成本高且效率低。即使使用预训练模型,由于其庞大的规模,部署这些模型仍然是一项挑战。除部署外,这些模型在推理时耗时更长,限制了用户友好性。主要瓶颈是自注意力,其时间和空间复杂度相对于序列长度呈二次方。为了降低自注意力机制的二次时间复杂度,Facebook 的 AI 研究团队引入了 Linformer,他们表明自注意力机制可由低秩矩阵近似,并利用这一发现提出了一种具有线性和空间复杂度的自注意力新方法。在 Linformer 中,时间复杂度依赖于作为超参数并影响模型性能的投影映射维度,调优该超参数可能很耗时。在本文中,我提出了一种替代的时空线性复杂度自注意力方法,且该方法独立于投影映射维度。由于该方法适用于长序列,因此也可用于图像和音频。

关键词

引用

@article{arxiv.2101.10277,
  title  = {Revisiting Linformer with a modified self-attention with linear complexity},
  author = {Madhusudan Verma},
  journal= {arXiv preprint arXiv:2101.10277},
  year   = {2021}
}