中文

IGB:弥补深度学习研究公开图数据集在标注、特征、异构性与规模上的不足

机器学习 2023-06-23 v2 人工智能 分布式、并行与集群计算 信息检索

摘要

图神经网络(GNNs)在多种现实世界中的挑战性应用上展现出很高的潜力,但 GNN 研究的主要障碍之一是缺乏大规模灵活的数据集。现有大多数用于 GNN 的公开数据集规模相对较小,这限制了 GNN 对未知数据的泛化能力。少数现有大规模图数据集提供的标注数据非常有限,这使得难以判断 GNN 模型在未知数据上低准确率究竟是源于训练数据不足,还是模型未能泛化。此外,用于训练 GNN 的数据集需要具备灵活性,以便在对 GNN 模型训练时对各种因素的影响进行深入研究。在本工作中,我们介绍了 Illinois Graph Benchmark(IGB),这是一个供开发者用于高保真地训练、审视并系统评估 GNN 模型的研究数据集工具。IGB 包含规模巨大的同质与异质学术图,其中超过 40% 的节点被标注。与公开可用的最大图数据集相比,IGB 为深度学习从业者和开发者提供了超过 162 倍的标注数据,以构建和评估具有更高准确率的模型。IGB 数据集是一系列学术图的集合,设计为灵活可用,能够支持对各种 GNN 架构、嵌入生成技术的研究,以及针对节点分类任务分析系统性能问题。IGB 已开源,支持 DGL 和 PyG 框架,并发布了原始文本,我们相信这将促进新兴语言模型与 GNN 研究项目。IGB 的早期公开版本可在 https://github.com/IllinoisGraphBenchmark/IGB-Datasets 获取。

关键词

引用

@article{arxiv.2302.13522,
  title  = {IGB: Addressing The Gaps In Labeling, Features, Heterogeneity, and Size of Public Graph Datasets for Deep Learning Research},
  author = {Arpandeep Khatua and Vikram Sharma Mailthody and Bhagyashree Taleka and Tengfei Ma and Xiang Song and Wen-mei Hwu},
  journal= {arXiv preprint arXiv:2302.13522},
  year   = {2023}
}

备注

Accepted in KDD'23 conference. This is final preprint version