中文

注意力并非你所需要的一切:纯注意力随深度呈双指数级秩损失

机器学习 2023-08-02 v2

摘要

基于注意力的架构已在机器学习中无处不在,然而我们对其有效性原因的理解仍然有限。本文提出一种理解自注意力网络的新方式:我们证明其输出可分解为若干较小项之和,每项涉及跨层的注意力头序列操作。利用该分解,我们证明自注意力对“token 均匀性”具有强归纳偏置。具体而言,若无跳跃连接或多层感知机(MLP),输出会以双指数速度收敛至秩-1 矩阵。另一方面,跳跃连接与 MLP 可阻止输出退化。我们的实验在不同标准 transformer 架构变体上验证了所识别的收敛现象。

关键词

引用

@article{arxiv.2103.03404,
  title  = {Attention is Not All You Need: Pure Attention Loses Rank Doubly Exponentially with Depth},
  author = {Yihe Dong and Jean-Baptiste Cordonnier and Andreas Loukas},
  journal= {arXiv preprint arXiv:2103.03404},
  year   = {2023}
}