中文

仅注意力 Transformer 及用注意力头实现 MLP

机器学习 2023-09-18 v1

摘要

Transformer 架构在机器学习模型中广泛使用,由两个交替的子层组成:注意力头和 MLP。我们证明,只要 MLP 的激活函数来自包含 SiLU 以及 ReLU 和 GeLU 的近似函数的受限类,一个 MLP 神经元就可以由一个内部维度为 1 的掩码注意力头实现。这使得人们能够以大幅增加注意力头数量为代价,将 MLP 与注意力的 Transformer 转换为仅注意力的 Transformer。我们还证明注意力头可以分别执行 MLP 的组成部分(线性变换和激活函数)。最后,我们证明注意力头可以在其权重矩阵中以任意小误差编码任意掩码模式。

关键词

引用

@article{arxiv.2309.08593,
  title  = {Attention-Only Transformers and Implementing MLPs with Attention Heads},
  author = {Robert Huben and Valerie Morris},
  journal= {arXiv preprint arXiv:2309.08593},
  year   = {2023}
}

备注

11 pages