中文

MOTGNN:用于多组学疾病分类的可解释图神经网络

机器学习 2026-02-12 v2 基因组学 机器学习

摘要

整合多组学数据,如DNA甲基化、mRNA表达和microRNA(miRNA)表达,为理解疾病背后的生物学机制提供了全面视角。然而,多组学数据的高维性、模态间的异质性以及缺乏可靠的生物交互网络,使得有意义的整合充满挑战。此外,许多现有模型依赖于手工构建的相似性图,易受类别不平衡影响,且通常缺乏内置的可解释性,限制了它们在生物医学应用中的实用性。我们提出了基于树生成图神经网络的多组学整合框架(MOTGNN),这是一种新颖且可解释的二元疾病分类框架。MOTGNN 采用极端梯度提升(XGBoost)进行组学特异性监督图构建,随后使用模态特异性图神经网络(GNN)进行层次表示学习,并使用深度前馈网络进行跨组学整合。在三个真实世界疾病数据集上,MOTGNN 在准确率、ROC-AUC 和 F1 分数上比最先进的基线模型高出 5-10%,并且在严重的类别不平衡情况下保持稳健。该模型通过使用稀疏图保持计算效率,并提供内置的可解释性,揭示排名靠前的生物标志物以及每个组学模态的相对贡献。这些结果凸显了 MOTGNN 在提高多组学疾病建模的预测准确性和可解释性方面的潜力。

关键词

引用

@article{arxiv.2508.07465,
  title  = {MOTGNN: Interpretable Graph Neural Networks for Multi-Omics Disease Classification},
  author = {Tiantian Yang and Zhiqian Chen},
  journal= {arXiv preprint arXiv:2508.07465},
  year   = {2026}
}

备注

11 pages, 6 figures, 7 tables