GNN-Suite:面向生物医学信息的图神经网络基准测试框架
摘要
我们提出 GNN-Suite,一个用于构建和评估计算生物学中图神经网络(GNN)架构的稳健模块化框架。GNN-Suite 采用 Nextflow 工作流程来标准化实验和可重复性,以评估 GNN 的性能。我们演示了其在识别癌症驱动基因方面的实用性,通过从 STRING 和 BioGRID 的蛋白质-蛋白相互作用(PPI)数据构建分子网络,并使用来自 PCAWG、PID 和 COSMIC-CGC 数据仓库的节点特征进行注释。我们的设计使 diverse GNN 架构(包括 GAT、GAT3H、GCN、GCN2、GIN、GTN、HGCN、PHGCN 和 GraphSAGE)以及基线 Logistic 回归(LR)模型之间能够进行公平比较。所有 GNN 均配置为标准化的两层模型,并使用统一的超参数(dropout = 0.2;Adam 优化器,学习率 = 0.01;以及调整后的二元交叉熵损失以解决类别不平衡)在 80/20 的训练-测试划分上训练 300 个 epoch。每个模型在 10 个独立运行中评估,每次使用不同的随机种子,以获得统计上稳健的性能指标,以平衡准确率(BACC)作为主要衡量标准。值得注意的是,GCN2 在基于 STRING 的网络上取得最高的 BACC(0.807 ± 0.035),尽管所有 GNN 类型都超过了 LR 基线,凸显了基于网络的学习相对于仅使用特征的方法的优势。我们的结果表明,一个通用的框架用于实现和评估 GNN 架构有助于识别不仅是最佳模型,还是最有效地整合互补数据的手段。通过使 GNN-Suite 公开可用,我们旨在促进可重复研究并推动计算生物学中改进的基准测试标准。未来工作将探索额外的组学数据集并进一步细化网络架构,以提高生物医学应用中的预测准确性和可解释性。
引用
@article{arxiv.2505.10711,
title = {GNN-Suite: a Graph Neural Network Benchmarking Framework for Biomedical Informatics},
author = {Sebestyén Kamp and Giovanni Stracquadanio and T. Ian Simpson},
journal= {arXiv preprint arXiv:2505.10711},
year = {2025}
}
备注
Main article 8 pages (20 in total with supplementary information included), 3 main article figures and 3 supplemental figures