GLaDiGAtor:基于语言模型增强的多关系图学习用于预测疾病-基因关联
机器学习
2026-02-24 v1 人工智能
摘要
理解疾病-基因关联有助于阐明疾病机制并推进诊断和治疗。传统方法依赖人工策源和文献综述,耗时且不可扩展,促使使用机器学习处理大规模生物医学数据。特别是图神经网络(GNN)在建模复杂生物关系方面显示出前景。为解决现有模型的局限,本文提出了 GLaDiGAtor(Graph Learning-bAsed DIsease-Gene AssociaTiOn pRediction),一个新型 GNN 框架,采用编码器-解码器体系结构用于疾病-基因关联预测。GLaDiGAtor 构建了一个异构生物图,整合了基因-基因、疾病-疾病以及基因-疾病相互作用,来自策源数据库的上下文特征通过著名语言模型(ProtT5 用于蛋白质序列,BioBERT 用于疾病文本)被增强到每个节点。 在评估中,我们的模型在预测准确性和泛化能力方面均优于 14 种现有方法。文献支持的案例研究确认了高置信度新预测的生物学相关性,凸显了 GLaDiGAtor 发现候选疾病基因的潜力。这些结果凸显了图卷积网络在生物医学信息学中的强大能力,最终可能通过揭示新的基因-疾病联系来促进药物发现。源代码和处理后的数据集已在 https://github.com/HUBioDataLab/GLaDiGAtor 公开获取。
引用
@article{arxiv.2602.18769,
title = {GLaDiGAtor: Language-Model-Augmented Multi-Relation Graph Learning for Predicting Disease-Gene Associations},
author = {Osman Onur Kuzucu and Tunca Doğan},
journal= {arXiv preprint arXiv:2602.18769},
year = {2026}
}