中文

论图神经网络的自蒸馏

机器学习 2021-05-03 v2 机器学习

摘要

近来,师生知识蒸馏框架在训练图神经网络(GNNs)中展现了潜力。然而,由于训练过参数化 GNN 模型的困难,人们不易获得令人满意的用于蒸馏的教师模型。此外,师生知识蒸馏低效的训练过程也阻碍其在 GNN 模型中的应用。本文提出首个面向 GNN 的无教师知识蒸馏方法,称为 GNN 自蒸馏(GNN-SD),可作为标准训练过程的直接替代。该方法建立在所提出的邻域差异率(NDR)之上,后者以高效方式量化嵌入图的非平滑性。基于该度量,我们提出自适应差异保持(ADR)正则化器,以增强跨 GNN 层保持高邻域差异的知识的可迁移性。我们还总结了一个通用 GNN-SD 框架,可用于诱导其他蒸馏策略。实验进一步证明了我们方法的有效性与泛化性,因其带来:1) 以更少训练成本实现最先进的 GNN 蒸馏性能,2) 对各种流行骨干网络一致且可观的性能提升。

关键词

引用

@article{arxiv.2011.02255,
  title  = {On Self-Distilling Graph Neural Network},
  author = {Yuzhao Chen and Yatao Bian and Xi Xiao and Yu Rong and Tingyang Xu and Junzhou Huang},
  journal= {arXiv preprint arXiv:2011.02255},
  year   = {2021}
}