均匀区分:自注意力与虚拟节点
机器学习
2024-05-21 v1
摘要
图Transformer(GT),如SAN和GPS,是将消息传递GNN(MPGNN)与全局自注意力相结合的图处理模型。它们被证明是通用函数逼近器,但有两个保留条件:1. 初始节点特征必须用某些位置编码进行增强。2. 逼近是非均匀的:不同大小的图可能需要不同的逼近网络。我们首先澄清,这种形式的通用性并非GT独有:使用相同的位置编码,纯MPGNN甚至2层MLP也是非均匀通用逼近器。然后我们考虑均匀表达能力:目标函数应由单个网络对所有大小的图进行逼近。在此,我们将GT与更高效的MPGNN+虚拟节点架构进行比较。两种模型定义的本质区别在于其全局计算方法——自注意力与虚拟节点。我们证明这两种模型都不是均匀通用逼近器,然后证明我们的主要结果:两种模型的均匀表达能力互不包含。我们通过合成数据上的实验来验证理论。我们进一步用真实数据集补充研究,观察到混合结果,表明在实践中也没有明确的排序。
引用
@article{arxiv.2405.11951,
title = {Distinguished In Uniform: Self Attention Vs. Virtual Nodes},
author = {Eran Rosenbluth and Jan Tönshoff and Martin Ritzert and Berke Kisin and Martin Grohe},
journal= {arXiv preprint arXiv:2405.11951},
year = {2024}
}