中文

线性Transformer中的隐患

计算与语言 2022-10-20 v1 机器学习

摘要

线性 Transformer 旨在降低标准 Transformer 的二次时空复杂度。然而,它们通常在各类任务和语料上表现下降。本文中,我们审视现有的基于核的线性 Transformer,并识别出导致此类性能差距的两个关键问题:1)注意力计算中的无界梯度 adversely 影响线性 Transformer 模型的收敛;2)注意力稀释,即 trivially 将注意力分数分布于长序列而忽略邻近结构。为解决这些问题,我们首先确定注意力矩阵的缩放是无界梯度中的隐患,并且如我们从理论与实证所示,在线性注意力中该缩放实非必要。为此,我们提出一种新的线性注意力,以归一化替代缩放操作以稳定梯度。针对注意力稀释问题,我们利用对角注意力将早期层的注意力限制于仅邻近词元。得益于稳定梯度与改进注意力,我们的新线性 Transformer 模型 transNormer 在文本分类与语言建模任务以及具挑战性的 Long-Range Arena 基准上均展现出优越性能,以明显优势超越标准 Transformer 与现有线性变体,同时具备显著更高的时空效率。代码见 https://github.com/OpenNLPLab/Transnormer 。

关键词

引用

@article{arxiv.2210.10340,
  title  = {The Devil in Linear Transformer},
  author = {Zhen Qin and XiaoDong Han and Weixuan Sun and Dongxu Li and Lingpeng Kong and Nick Barnes and Yiran Zhong},
  journal= {arXiv preprint arXiv:2210.10340},
  year   = {2022}
}

备注

accepted to EMNLP2022