中文

通过核主分量分析揭示自注意力的隐藏结构

机器学习 2024-11-01 v2 人工智能 计算与语言 计算机视觉与模式识别 机器学习

摘要

transformer在序列建模任务中取得惊人的成功,涵盖自然语言处理和计算机视觉等各种应用,这归功于自注意力机制在其中的关键作用。类似地,大多数深度学习模型的构建都依赖于启发式方法和经验。在本工作中,我们从核主分量分析(kernel PCA)推导自注意力,表明自注意力将其查询向量投影到其键矩阵在特征空间中的主成分轴上。我们然后形式化了值矩阵在自注意力中的确切公式,理论和实证地表明,该值矩阵捕获了自注意力中键向量的Gram矩阵的特征向量。利用我们的核PCA框架,我们提出了一种基于鲁棒主分量(RPC-Attention)的注意力机制,这是一种对数据污染具有鲁棒性的新型注意力。我们在ImageNet-1K对象分类、WikiText-103语言建模和ADE20K图像分割任务上,实证地表明RPC-Attention在softmax注意力方面具有优势。

关键词

引用

@article{arxiv.2406.13762,
  title  = {Unveiling the Hidden Structure of Self-Attention via Kernel Principal Component Analysis},
  author = {Rachel S. Y. Teo and Tan M. Nguyen},
  journal= {arXiv preprint arXiv:2406.13762},
  year   = {2024}
}

备注

10 pages in the main text. Published at NeurIPS 2024. The code is available at https://github.com/rachtsy/KPCA_code