中文

重新审视大规模图训练中的效率与冗余

机器学习 2022-09-05 v1 人工智能

摘要

大规模图在真实场景中无处不在,可通过图神经网络(GNNs)训练以为下游任务生成表示。鉴于大规模图信息丰富且拓扑复杂,我们认为此类图中存在冗余,并会降低训练效率。遗憾的是,模型可扩展性严重限制了通过朴素GNNs训练大规模图的效率。尽管近期基于采样的训练方法取得了进展,但基于采样的GNNs普遍忽视了冗余问题。在这些大规模图上训练这些模型仍耗时难以忍受。因此,我们通过重新审视图中固有特征,提出去除冗余并提升GNNs训练大规模图的效率。本文率先提出一种一次性方法,称为DropReef,以去除大规模图中的冗余。具体而言,我们首先进行初步实验以探索大规模图中潜在的冗余。接下来,我们提出一个度量来量化图中所有节点的邻居异质性。基于实验和理论分析,我们揭示了大规模图中的冗余,即具有高邻居异质性和大量邻居的节点。然后,我们提出DropReef一次性检测并去除大规模图中的冗余,从而在保证模型精度不损失的前提下减少训练时间。为证明DropReef的有效性,我们将其应用于近期最先进的基于采样的GNNs以训练大规模图,得益于这些模型的高精度。借助DropReef,模型的训练效率可大幅提升。DropReef具有高度兼容性且离线执行,在很大程度上惠及当前和未来的最先进基于采样的GNNs。

关键词

引用

@article{arxiv.2209.00800,
  title  = {Rethinking Efficiency and Redundancy in Training Large-scale Graphs},
  author = {Xin Liu and Xunbin Xiong and Mingyu Yan and Runzhen Xue and Shirui Pan and Xiaochun Ye and Dongrui Fan},
  journal= {arXiv preprint arXiv:2209.00800},
  year   = {2022}
}

备注

11 Pages