中文

图变换器的 k-最大内积注意力及其表达力:GraphGPS 分析

机器学习 2026-04-09 v2 人工智能

摘要

图变换器在克服传统图神经网络的局限性方面显示出前景,如过度压缩和难以建模长程依赖问题。然而,其应用于大规模图时受限于所有-to-all 注意力机制的二次内存和计算复杂度。虽然已提出线性化注意力和受限注意力模式等替代方案,但这些方法常会降低性能或限制表达力。为更好地平衡效率与效果,我们引入 k-最大内积 (k-MIP) 注意力用于图变换器。k-MIP 注意力通过选择每个查询的最相关键节点(通过 top-k 操作),实现稀疏且灵活的注意力模式。结合基于符号矩阵的注意力得分计算,这导致线性内存复杂度,并使处理 50 万节点以上图的速度提升约一个数量级。我们对表达力进行了理论分析,表明 k-MIP 注意力不会削弱图变换器的表达力:具体而言,我们证明 k-MIP 变换器可以以任意精度近似任何全注意力变换器。此外,我们分析了将注意力机制集成到 GraphGPS 框架中的表达力,并以 S-SEG-WL 测试为界限给出其图区分能力的上界。最后,我们在 Long Range Graph Benchmark、City-Networks 基准以及两个自定义的大规模归纳点云数据集上验证了方法,始终在可扩展图变换器中名列前茅。

关键词

引用

@article{arxiv.2604.03815,
  title  = {k-Maximum Inner Product Attention for Graph Transformers and the Expressive Power of GraphGPS},
  author = {Jonas De Schouwer and Haitz Sáez de Ocáriz Borde and Xiaowen Dong},
  journal= {arXiv preprint arXiv:2604.03815},
  year   = {2026}
}

备注

Accepted at the ICLR 2026 GRaM Workshop. 9 pages, 9 figures, 16 tables; 30 pages of supplementary material