普通 Transformer 如何成为强大的图学习器
机器学习
2026-01-30 v3 计算与语言
摘要
Transformer 在各种模态上取得了卓越的性能,这归功于其简单而强大的 scaled-dot-product(SDP)注意力机制。研究人员曾尝试将 Transformer 迁移到图学习领域,但大多数先进的图 Transformer(GTs)已远离普通 Transformer,表现出通过集成消息传递或包含复杂注意力机制等显著的架构差异,这些差异阻碍了跨域 Transformer 训练进展的轻松采用。与此不同,本文表明普通 Transformer 架构可以是强大的图学习器。为此,我们提出了对普通 Transformer 架构进行三项简单、最小且易于实现的修改,以构建我们的 Powerful Plain Graph Transformers(PPGT):(1)简化的 注意力用于衡量 token 之间的幅度接近性;(2)自适应均方根归一化以保留 token 幅度信息;(3)基于简单的 MLP 的 stem 用于图位置编码。Consistent with its theoretical expressivity, PPGT 在经验图 expressivity benchmark 上表现出值得注意的实际表达性,与更复杂的替代方案(如子图 GNN 和高阶 GNN)相媲美。其在各种图数据集上的经验性能也证明了 PPGT 的有效性。这一发现凸显了普通 Transformer 架构的多样性,并突显了其作为跨语言、视觉和图域统一 backbone 的强大潜力。
关键词
引用
@article{arxiv.2504.12588,
title = {Plain Transformers Can be Powerful Graph Learners},
author = {Liheng Ma and Soumyasundar Pal and Yingxue Zhang and Philip H. S. Torr and Mark Coates},
journal= {arXiv preprint arXiv:2504.12588},
year = {2026}
}