中文

基于奇异值域的高级自注意力学习:线性Transformer

机器学习 2025-05-14 v1 人工智能

摘要

Transformer在多个领域展现出卓越性能,其关键组件是自注意力机制,学习输入序列中任意两个token之间的关系。近期研究表明,自注意力可被视为图的归一化邻接矩阵。从图信号处理(GSP)的角度看,自注意力等价于简单图滤波器,利用值向量作为信号进行处理。然而,自注意力仅定义于多项式矩阵的一次项,表现为低通滤波器,限制了对多种频率信息的有效利用。因此,现有自注意力机制设计较为简化。本文提出新方法,称为Attentive Graph Filter (AGF),从GSP视角将自注意力解释为在奇异值域上学习图滤波器,适用于有向图,时间复杂度随输入长度 nn 的线性,即 O(nd2)\mathcal{O}(nd^2)。实验表明,AGF在多个任务上实现最先进性能,包括Long Range Arena基准和时间序列分类。

关键词

引用

@article{arxiv.2505.08516,
  title  = {Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain},
  author = {Hyowon Wi and Jeongwhan Choi and Noseong Park},
  journal= {arXiv preprint arXiv:2505.08516},
  year   = {2025}
}

备注

IJCAI25 Accepted