SGFormer:具有无近似线性复杂度的单层图 Transformer
机器学习
2024-09-16 v1 人工智能
摘要
由于节点间的相互依赖特性,在大图上学习表示一直是一个长期挑战。Transformer 最近在小图上展现出有前景的性能,这得益于其能捕获超出观测结构的所有节点对交互的全局注意力。现有方法倾向于继承 Transformer 在语言和视觉任务中的思想,并通过堆叠基于注意力的深层传播层来采用复杂的架构。在本文中,我们试图评估在图 Transformer 中采用多层注意力的必要性,因为这极大地限制了效率。具体来说,我们分析了一个由全对注意力和基于图的传播组成的通用混合传播层,并证明多层传播可以简化为单层传播,且具有相同的表示学习能力。这为构建强大且高效的图 Transformer 指明了一条新的技术路径,特别是通过简化模型架构而不牺牲表达能力。正如本工作所展示的,我们提出了一种简化的单层图 Transformer(SGFormer),其主要组件是一个单层全局注意力,其复杂度随图大小线性缩放,且无需任何近似即可容纳所有节点对交互。实验证明,SGFormer 成功扩展到网络级图 ogbn-papers100M,在中等规模图上相比同类 Transformer 实现了数量级的推理加速,并在有限标记数据下展现出竞争力。
引用
@article{arxiv.2409.09007,
title = {SGFormer: Single-Layer Graph Transformers with Approximation-Free Linear Complexity},
author = {Qitian Wu and Kai Yang and Hengrui Zhang and David Wipf and Junchi Yan},
journal= {arXiv preprint arXiv:2409.09007},
year = {2024}
}
备注
Extended version of NeurIPS2023 contribution arXiv:2306.10759