中文

一种具有双重自蒸馏的无教师图知识蒸馏框架

机器学习 2024-03-07 v1

摘要

近年来,利用图神经网络(GNNs)处理图相关任务取得了巨大成功。尽管在学术界取得了巨大成功,但多层感知机(MLPs)仍然是实际工业应用的主力军。造成这种学术界与工业界差距的原因之一是 GNNs 中数据依赖性导致的邻域获取延迟。为了缩小这一差距,人们提出了图知识蒸馏(GKD),通常基于标准的教师 - 学生架构,将知识从大型教师 GNN 蒸馏到轻量级学生 GNN 或 MLP 中。然而,我们在本文中发现,对于图知识蒸馏而言,教师模型和 GNNs 都不是必需的。我们提出了一种无教师图自蒸馏(TGS)框架,其在训练和推理过程中均不需要任何教师模型或 GNNs。更重要的是,所提出的 TGS 框架完全基于 MLPs,其中结构信息仅被隐式地用于指导目标节点与其邻域之间的双重知识自蒸馏。因此,TGS 在训练中享有图拓扑感知的优势,而在推理中则不受数据依赖性的限制。大量实验表明,双重自蒸馏可以显著提高普通 MLPs 的性能,例如,TGS 比普通 MLPs 平均提高了 15.54%,并在六个真实世界数据集上优于最先进的 GKD 算法。在推理速度方面,TGS 的推理速度比现有 GNNs 快 75-89 倍,比经典推理加速方法快 16-25 倍。

关键词

引用

@article{arxiv.2403.03483,
  title  = {A Teacher-Free Graph Knowledge Distillation Framework with Dual Self-Distillation},
  author = {Lirong Wu and Haitao Lin and Zhangyang Gao and Guojiang Zhao and Stan Z. Li},
  journal= {arXiv preprint arXiv:2403.03483},
  year   = {2024}
}

备注

arXiv admin note: substantial text overlap with arXiv:2210.02097