中文

用于癌症生物标志物发现的生物医学知识图谱

人工智能 2023-02-24 v2

摘要

关于药物、基因、蛋白质、病毒及其机制的的结构化和非结构化数据与事实分散在大量科学文章中。这些文章是大规模知识源,对传播特定生物过程机制的知识具有巨大影响。领域特定知识图谱(KG)是针对特定主题领域、以语义相互关联的实体和关系表示的显式概念化。通过整合此类事实与数据可构建 KG,并用于数据集成、探索和联邦查询。然而,由于缺乏对底层数据资产或语义技术的了解,某些用户群体探索和查询大规模 KG 十分繁琐。此类 KG 不仅能推导新知识和问答(QA),还能让领域专家进行探索。由于跨学科解释对准确诊断十分重要,查询 KG 以提供关于已学习生物标志物的交互式解释是必要的。受此启发,我们构建了一个领域特定 KG,尤其面向癌症特异性生物标志物发现。该 KG 通过整合来自多个来源的癌症相关知识与事实构建。首先,我们构建了一个领域特定本体,称为 OncoNet 本体(ONO)。ONO 本体的开发旨在实现语义推理,以验证疾病与基因之间关系的预测。随后,通过使用基于 BERT 的信息抽取方法,对 ONO、附加元数据模式、本体、受控词表以及外部来源的附加概念进行协调,开发并丰富了该 KG。BioBERT 和 SciBERT 使用从 PubMed 爬取的选定文章进行了微调。我们列举了基于该 KG 的一些查询以及 QA 和知识推导的示例。

关键词

引用

@article{arxiv.2302.04737,
  title  = {A Biomedical Knowledge Graph for Biomarker Discovery in Cancer},
  author = {Md. Rezaul Karim and Lina Molinas Comet and Oya Beyan and Dietrich Rebholz-Schuhmann and Stefan Decker},
  journal= {arXiv preprint arXiv:2302.04737},
  year   = {2023}
}