中文

论自注意力矩阵的表达能力

机器学习 2021-06-09 v2

摘要

Transformer网络能够以极少或无需改变架构组件的方式,捕捉来自许多领域(文本、图像、视频、蛋白质等)数据中的模式。我们对负责元素间信号传播的核心组件,即自注意力矩阵,进行了理论分析。在实践中,该矩阵通常表现出两个性质:(1)它是稀疏的,意味着每个词元只关注其他词元的一个小子集;(2)它根据模块的输入动态变化。考虑到这些,我们提出以下问题:一个固定的自注意力模块能否根据输入逼近任意稀疏模式?这种逼近所需的隐藏维度dd最小是多少?我们在回答该问题上取得进展,并证明自注意力矩阵可证明地逼近稀疏矩阵,其中稀疏性是指每行和每列中非零元素个数有界。尽管自注意力的参数是固定的,但仅通过修改输入即可逼近各种稀疏矩阵。我们的证明基于随机投影技术并使用了开创性的Johnson-Lindenstrauss引理。我们的证明是构造性的,使我们能够提出一种算法,用于寻找自适应输入和固定的自注意力参数以逼近给定矩阵。特别地,我们证明,为了以给定精度(由保持矩阵元素比例定义)逼近任意稀疏矩阵,dd仅随序列长度LL对数增长(即d=O(logL)d = O(\log L))。

关键词

引用

@article{arxiv.2106.03764,
  title  = {On the Expressive Power of Self-Attention Matrices},
  author = {Valerii Likhosherstov and Krzysztof Choromanski and Adrian Weller},
  journal= {arXiv preprint arXiv:2106.03764},
  year   = {2021}
}