中文

使用低秩权重矩阵的单层自注意力 Transformer 是否为通用逼近器?

机器学习 2024-01-30 v3

摘要

现有对 Transformer 模型表达能力进行分析的工作需要过深的层数才能实现数据记忆,导致其与实践中实际使用的 Transformer 之间存在差距。这主要源于将 softmax 函数解释为 hardmax 函数的近似。通过阐明 softmax 函数与 Boltzmann 算子之间的联系,我们证明了具有低秩权重矩阵的单层自注意力能够完美捕捉整个输入序列的上下文。由此,我们表明单层单头 Transformer 对有限样本具有记忆能力,且由一个自注意力层与两个前馈神经网络构成的 Transformer 是紧致域上连续置换等变函数的通用逼近器。

关键词

引用

@article{arxiv.2307.14023,
  title  = {Are Transformers with One Layer Self-Attention Using Low-Rank Weight Matrices Universal Approximators?},
  author = {Tokio Kajitsuka and Issei Sato},
  journal= {arXiv preprint arXiv:2307.14023},
  year   = {2024}
}

备注

ICLR 2024