中文

Gradformer:带指数衰减的图Transformer

机器学习 2024-04-25 v1

摘要

图Transformer(GT)在广泛的任务中展示出显著优势。然而,GT的自注意力机制忽略了图的归纳偏置,尤其是与结构相关的偏置,这些偏置对于图任务至关重要。虽然一些方法利用位置编码和注意力偏置来建模归纳偏置,但其效果在分析上仍不够理想。因此,本文提出了Gradformer,一种创新地将GT与固有归纳偏置集成的方法,通过对注意力矩阵应用指数衰减掩码来实现。具体而言,衰减掩码矩阵中的值呈指数衰减,与图结构中节点距离的减小相关。这一设计使Gradformer能够在捕获远距离节点信息的同时,专注于图的局部细节。此外,Gradformer引入可学习的约束到衰减掩码中,允许不同的注意力头学习不同的衰减掩码。这种设计多样化了注意力头,使其能够更有效地整合图中多样化的结构信息。广泛的基准实验表明,Gradformer在各种图分类和回归任务中 consistently 优于图神经网络和GT基线模型。此外,Gradformer被证明是训练深层GT模型的有效方法,与浅层模型相比,即使在网络加深时也能保持甚至提升准确率,这与其他GT模型在网络加深时显著准确率下降的现象形成鲜明对比。代码已在GitHub公开:https://github.com/LiuChuang0059/Gradformer。

关键词

引用

@article{arxiv.2404.15729,
  title  = {Gradformer: Graph Transformer with Exponential Decay},
  author = {Chuang Liu and Zelin Yao and Yibing Zhan and Xueqi Ma and Shirui Pan and Wenbin Hu},
  journal= {arXiv preprint arXiv:2404.15729},
  year   = {2024}
}

备注

9 pages, 7 figures. Accepted by IJCAI 2024