中文

图蒸馏能否像视觉数据集蒸馏那样发挥作用?

机器学习 2023-10-16 v1 人工智能

摘要

在大规模图上的训练已在图表示学习中取得显著成果,但其成本与存储问题日益引发关注。现有的图压缩方法主要侧重于优化压缩图的特征矩阵,而忽视了原始图结构信息的影响。为探究结构信息的影响,我们从谱域进行分析,并实证发现以往工作中存在显著的拉普拉斯能量分布(Laplacian Energy Distribution, LED)偏移。此类偏移导致在跨架构泛化及异常检测、链接预测等特定任务上性能不佳。本文提出一种新颖的结构广播式图数据集蒸馏(Structure-broadcasting Graph Dataset Distillation, SGDD)方案,将原始结构信息广播至合成图的生成过程中,从而显式避免忽视原始结构信息。理论上,SGDD生成的合成图相比以往工作具有更小的LED偏移,从而在跨架构设定与特定任务上均取得更优性能。我们在9个数据集上验证了所提SGDD,并在所有数据集上达到最先进(state-of-the-art, SOTA)结果:例如在YelpChi数据集上,我们的方法以图规模千分之一的代价保持了在原始图数据集上训练98.6%的测试准确率。此外,我们实证评估发现跨9个数据集的LED偏移减少了17.6%~31.4%。大量实验与分析验证了所提设计的有效性与必要性。代码已在GitHub仓库提供:https://github.com/RingBDStack/SGDD。

关键词

引用

@article{arxiv.2310.09192,
  title  = {Does Graph Distillation See Like Vision Dataset Counterpart?},
  author = {Beining Yang and Kai Wang and Qingyun Sun and Cheng Ji and Xingcheng Fu and Hao Tang and Yang You and Jianxin Li},
  journal= {arXiv preprint arXiv:2310.09192},
  year   = {2023}
}

备注

Accepted by NeurIPS 2023