OGB-LSC:面向图机器学习的大规模挑战赛
机器学习
2021-10-22 v3
摘要
实现针对大规模图数据(例如具有数十亿条边的图)有效且高效的机器学习(ML)可对工业和科学应用产生重大影响。然而,现有推进大规模图机器学习的努力在很大程度上受限于缺乏合适的公共基准。在此我们提出 OGB 大规模挑战赛(OGB-LSC),一个由三个真实世界数据集组成的集合,用于促进大规模图机器学习的发展。OGB-LSC 数据集比现有数据集大数个数量级,涵盖三个核心图学习任务——链接预测、图回归和节点分类。此外,我们提供了专门的基线实验,将具表达力的图机器学习模型扩展到海量数据集上。我们表明,具表达力的模型显著优于简单的可扩展基线,表明有必要投入专门努力以进一步提升大规模图机器学习水平。而且,OGB-LSC 数据集已部署于 ACM KDD Cup 2021,吸引了全球超过 500 支队伍注册,期间多种创新技术带来了显著的性能提升。我们总结了获胜方案使用的常见技术,并强调了当前大规模图机器学习的最佳实践。最后,我们描述了在 KDD Cup 之后如何更新数据集以进一步促进研究进展。OGB-LSC 数据集、基线代码以及关于 KDD Cup 的所有信息可在 https://ogb.stanford.edu/docs/lsc/ 获取。
引用
@article{arxiv.2103.09430,
title = {OGB-LSC: A Large-Scale Challenge for Machine Learning on Graphs},
author = {Weihua Hu and Matthias Fey and Hongyu Ren and Maho Nakata and Yuxiao Dong and Jure Leskovec},
journal= {arXiv preprint arXiv:2103.09430},
year = {2021}
}
备注
KDD Cup 2021. NeurIPS Datasets and Benchmarks Track 2021