用于图表示学习的大规模数据库
机器学习
2021-11-09 v3 人工智能
密码学与安全
计算机视觉与模式识别
社会与信息网络
摘要
随着图表示学习的迅速兴起,构建新的大规模数据集对于区分模型能力并准确评估各项技术的优缺点十分必要。通过仔细分析现有图数据库,我们确定了推动图表示学习领域发展所需的三个关键组成部分:(1) 大图,(2) 多图,(3) 类别多样性。迄今为止,尚无单一图数据库同时具备所有这些期望属性。我们推出 MalNet,这是迄今构建的最大公共图数据库,代表了一个恶意软件函数调用图的大规模本体。MalNet 包含超过 120 万张图,每张图平均超过 15k 个节点和 35k 条边,涵盖 47 种类型和 696 个家族的层级结构。与流行的 REDDIT-12K 数据库相比,MalNet 提供的图数量多 105 倍,平均图规模大 39 倍,类别多 63 倍。我们对 MalNet 进行了详细分析,讨论其属性与来源,并对最先进的机器学习和图神经网络技术进行了评估。MalNet 前所未有的规模和多样性为推进图表示学习的前沿提供了令人兴奋的机遇——使得在不平衡分类、可解释性以及类别难度影响方面的新发现与研究成为可能。该数据库公开于 www.mal-net.org。
引用
@article{arxiv.2011.07682,
title = {A Large-Scale Database for Graph Representation Learning},
author = {Scott Freitas and Yuxiao Dong and Joshua Neil and Duen Horng Chau},
journal= {arXiv preprint arXiv:2011.07682},
year = {2021}
}
备注
Published in NeurIPS Datasets and Benchmarks Track, 2021