理解注意力层的词敏感性:一项基于随机特征的研究
机器学习
2024-05-20 v2 计算与语言
机器学习
摘要
理解 Transformer 取得卓越成功的原因,需要更好地分析为何注意力层适用于自然语言处理任务。特别是,此类任务要求预测模型能够捕捉上下文含义,而该含义往往取决于一个或少数几个词,即使句子很长。我们的工作在随机特征的典型设定下研究了这一关键属性,即词敏感性(word sensitivity, WS)。我们表明,注意力层具有高 WS,即在嵌入空间中存在一个向量,能大幅扰动随机注意力特征映射。该论证关键性地利用了注意力层中 softmax 的作用,突显了其相较于其他激活函数(如 ReLU)的优势。相比之下,标准随机特征的 WS 量级为 ,其中 为文本样本中的词数,因此随上下文长度增加而衰减。随后,我们将这些关于词敏感性的结果转化为泛化界:由于 WS 较低,随机特征被证明无法学习区分仅在一个词上不同的两个句子;相反,由于具有高 WS,随机注意力特征具备更强的泛化能力。我们在 imdb 评论数据集的 BERT-Base 词嵌入上通过实验验证了我们的理论结果。
引用
@article{arxiv.2402.02969,
title = {Towards Understanding the Word Sensitivity of Attention Layers: A Study via Random Features},
author = {Simone Bombari and Marco Mondelli},
journal= {arXiv preprint arXiv:2402.02969},
year = {2024}
}
备注
Revision after ICML2024 reviews