图知识蒸馏:混合专家模型
机器学习
2024-11-22 v2 人工智能
机器学习
摘要
在准确性方面,图神经网络(GNN)是节点分类任务的最佳架构选择。其在实际部署中的缺点是源于邻域处理操作所产生的延迟。解决延迟问题的一种方法是将训练好的 GNN 进行知识蒸馏到多层感知机(MLP),其中 MLP 只处理被分类节点的特征(以及可能的一些预计算结构信息)。然而,现有知识蒸馏技术在 transductive 和 inductive 设置下,都表现出不一致的 MLP 性能。我们提出通过使用专为设计的学生模型来解决性能问题,而非使用 MLP。我们的模型称为 Routing-by-Memory(记忆路由,RbM),是一种混合专家(Mixture-of-Experts,MoE)形式,设计上强制专家具备特殊化能力。通过鼓励每个专家在隐藏表示空间的特定区域上进行专业化,我们在多个数据集上实验表明,可以推导出相当更一致的性能。代码已公开 https://github.com/Rufaim/routing-by-memory。
引用
@article{arxiv.2406.11919,
title = {Graph Knowledge Distillation to Mixture of Experts},
author = {Pavel Rumiantsev and Mark Coates},
journal= {arXiv preprint arXiv:2406.11919},
year = {2024}
}