中文

STRIDE:面向图神经网络的带注意力结构与嵌入蒸馏

机器学习 2025-08-19 v2

摘要

图神经网络(GNNs)近期的进展导致模型规模增大以提升容量与精度。此类大型模型带来高内存占用、高延迟与高计算成本,从而限制其推理部署。GNN压缩技术将大型GNN压缩为更小的模型且精度损失可忽略。最有前景的压缩技术之一是知识蒸馏(KD)。然而,多数面向GNN的KD方法仅考虑最后一层输出,而未考虑GNN中间层的输出。中间层可能包含由图结构与嵌入所指示的重要归纳偏置。忽略这些层可能导致较大精度下降,尤其在压缩率较高时。为弥补上述不足,我们提出一种用于GNN压缩的名为带注意力的结构与嵌入蒸馏(STRIDE)的新型KD方法。STRIDE利用注意力识别重要的中间师生层对,并聚焦于利用这些层对对齐图结构与节点嵌入。我们在多个数据集(如OGBN-Mag与OGBN-Arxiv)上使用不同模型架构(包括GCNII、RGCN与GraphSAGE)评估STRIDE。平均而言,在大型图数据集OGBN-Mag上,与最先进方法相比,STRIDE以32.3倍压缩率实现2.13%的精度提升。在较小数据集(如Pubmed)上,STRIDE以与最先进方法相同的精度实现高达141倍压缩率。这些结果凸显了关注中间层知识以获取紧凑、精确且实用的GNN模型的有效性。

关键词

引用

@article{arxiv.2310.15938,
  title  = {STRIDE: Structure and Embedding Distillation with Attention for Graph Neural Networks},
  author = {Anshul Ahluwalia and Payman Behnam and Rohit Das and Alind Khare and Biswadeep Chakraborty and Pan Li and Alexey Tumanov},
  journal= {arXiv preprint arXiv:2310.15938},
  year   = {2025}
}