中文

SFi-Former:稀疏流诱导注意力的图变换器

机器学习 2025-04-30 v1

摘要

图变换器(GT)在处理具有长程依赖关系的图数据方面表现优于传统的消息传递图神经网络。然而,由于注意力机制稀疏化不足,GTs往往存在弱归纳偏置、过拟合和过全局化问题。本文引入SFi注意力机制,通过最小化基于网络流能量函数并加入L1正则化来学习稀疏模式,从而缓解由稠密注意力引起的问题。基于此,本文设计SFi-Former,该模型可利用SFi注意力生成图数据邻接矩阵之外的稀疏网络流。具体而言,SFi-Former通过灵活调整稀疏注意力,选择性地从其他节点聚合特征,从而构建更稳健的模型。我们在各种图数据集上验证了SFi-Former,尤其是那些具有长程依赖关系的图数据。实验结果表明,SFi-Former在GNN基准数据集上表现竞争,在LongRange Graph基准(LRGB)数据集上达到SOTA性能。此外,本模型可产生更小的泛化间隙,表明其更不容易过拟合。点击此处获取代码。

关键词

引用

@article{arxiv.2504.20666,
  title  = {SFi-Former: Sparse Flow Induced Attention for Graph Transformer},
  author = {Zhonghao Li and Ji Shi and Xinming Zhang and Miao Zhang and Bo Li},
  journal= {arXiv preprint arXiv:2504.20666},
  year   = {2025}
}

备注

ICMR 2025