中文

MultiCNKG:利用大型语言模型整合认知神经科学、基因与疾病知识图谱

人工智能 2025-10-09 v1 机器学习

摘要

大型语言模型 (LLM) 的出现 revolutionized 了生物医学和认知科学中知识图谱 (KG) 的集成,克服了传统机器学习方法在捕捉基因、疾病和认知过程之间复杂语义联系方面的局限。我们引入 MultiCNKG,一个创新框架,将三个关键知识来源整合在内:认知神经科学知识图谱 (CNKG) 包含 2.9K 个节点和 4.3K 条边,覆盖 9 种节点类型和 20 种边类型;Gene Ontology (GO) 包含 43K 个节点和 75K 条边,涵盖 3 种节点类型和 4 种边类型;Disease Ontology (DO) 包含 11.2K 个节点和 8.8K 条边,包含 1 种节点类型和 2 种边类型。利用像 GPT-4 这样的 LLM,我们进行实体对齐、语义相似度计算和图增强,以创建相互关联的 KG,连接基因机制、神经疾病和认知功能。 resulting MultiCNKG 包含 6.9K 个节点,覆盖 5 种类型 (例如基因、疾病、认知过程),以及 11.3K 条边,涵盖 7 种类型 (例如 Causes, Associated with, Regulates),支持从分子到行为领域的多层次视图。通过包括精度 (85.20%)、召回率 (87.30%)、覆盖率 (92.18%)、图一致性 (82.50%)、新颖检测 (40.28%) 和专家验证 (89.50%) 等指标的评估,我们确认了其稳健性和一致性。链接预测评估使用 TransE (MR: 391, MRR: 0.411) 和 RotatE (MR: 263, MRR: 0.395) 显示其在 FB15k-237 和 WN18RR 等基准数据集上表现具有竞争力。该 KG 推动了个性化医学、认知障碍诊断和认知神经科学中的假设构建等应用。

关键词

引用

@article{arxiv.2510.06742,
  title  = {MultiCNKG: Integrating Cognitive Neuroscience, Gene, and Disease Knowledge Graphs Using Large Language Models},
  author = {Ali Sarabadani and Kheirolah Rahsepar Fard},
  journal= {arXiv preprint arXiv:2510.06742},
  year   = {2025}
}