论自注意力矩阵的表达能力
机器学习
2021-06-09 v2
摘要
Transformer网络能够以极少或无需改变架构组件的方式,捕捉来自许多领域(文本、图像、视频、蛋白质等)数据中的模式。我们对负责元素间信号传播的核心组件,即自注意力矩阵,进行了理论分析。在实践中,该矩阵通常表现出两个性质:(1)它是稀疏的,意味着每个词元只关注其他词元的一个小子集;(2)它根据模块的输入动态变化。考虑到这些,我们提出以下问题:一个固定的自注意力模块能否根据输入逼近任意稀疏模式?这种逼近所需的隐藏维度最小是多少?我们在回答该问题上取得进展,并证明自注意力矩阵可证明地逼近稀疏矩阵,其中稀疏性是指每行和每列中非零元素个数有界。尽管自注意力的参数是固定的,但仅通过修改输入即可逼近各种稀疏矩阵。我们的证明基于随机投影技术并使用了开创性的Johnson-Lindenstrauss引理。我们的证明是构造性的,使我们能够提出一种算法,用于寻找自适应输入和固定的自注意力参数以逼近给定矩阵。特别地,我们证明,为了以给定精度(由保持矩阵元素比例定义)逼近任意稀疏矩阵,仅随序列长度对数增长(即)。
引用
@article{arxiv.2106.03764,
title = {On the Expressive Power of Self-Attention Matrices},
author = {Valerii Likhosherstov and Krzysztof Choromanski and Adrian Weller},
journal= {arXiv preprint arXiv:2106.03764},
year = {2021}
}