GraphNetz:基于配对检验和秩聚合的图神经网络统计基准
计算工程、金融与科学
2026-05-12 v1 社会与信息网络
摘要
图神经网络 (GNN) 基准测试通常报告单点估计,即使性能差异相对于随机种子、训练/测试划分和数据集之间的变动很小。置信区间、配对比较、多重比较校正和基于秩的聚合是标准统计工具,但它们很少作为图学习基准套件的默认输出。在本文中,我们引入GraphNetz,其默认输出为结构化统计报告而非原始准确率表格。GraphNetz 当前包括63个数据集加载器、四种任务类型和五种标准GNN架构,同时支持自定义数据集和模型。该框架标准化了多随机种子评估,并自动返回每个单元格的置信区间、Holm校正后的配对检验以及跨任务的Friedman-Nemenyi 临界差异图。在十个异构任务上的跨类别基准测试中,四个标准节点级编码器之间的 apparent 排名差异落在单个 Nemenyi clique 内,表明在 时,没有哪一个显著优于其他任何一个。GraphNetz 因此为研究人员提供了一个可复制的计算和统计管道,用于对标准标准GNN架构进行新图学习方法的基准测试,涵盖不同任务和广泛的应用场景,同时报告原则化的统计证据,以进行基准测试,这一框架将为图学习社区提供一个可复现且诚实的模型比较工具。
引用
@article{arxiv.2605.09099,
title = {GraphNetz: Statistical Benchmarking of Graph Neural Networks with Paired Tests and Rank Aggregation},
author = {Kleyton da Costa and Bernardo Modenesi},
journal= {arXiv preprint arXiv:2605.09099},
year = {2026}
}