更稀疏的图变换器
机器学习
2024-11-26 v1 机器学习
摘要
图变换器在长程依赖建模方面表现优异, 但通常需要输入图中节点数的二次内存复杂度, 因此在大规模图上难以扩展。稀疏注意力变体如 Exphormer 有助于缓解此问题, 但可能需要对输入图进行高阶度增强以获得良好性能, 且未尝试稀疏化已经稠密的输入图。由于注意力得分倾向于仅使用其中少数边, 这种高阶连接可能是不必要的。我们通过经验和理论依据表明, 注意力得分在不同网络宽度之间通常相当一致, 并据此提出一种两阶段过程, 称为Spexphormer: 首先, 在完整增强图上训练一个窄网络; 接着, 只使用活跃连接, 在大幅稀疏化的图上训练一个更宽的网络。我们确立了窄网络注意力得分可匹配宽网络注意力得分的理论条件, 并展示Spexphormer 在各种图数据集上能够以大幅度降低内存需求获得良好性能。
引用
@article{arxiv.2411.16278,
title = {Even Sparser Graph Transformers},
author = {Hamed Shirzad and Honghao Lin and Balaji Venkatachalam and Ameya Velingker and David Woodruff and Danica Sutherland},
journal= {arXiv preprint arXiv:2411.16278},
year = {2024}
}