中文

从大语言模型到知识图谱:用于癌症生物标志物发现

计算与语言 2023-11-21 v2

摘要

领域专家常依赖最新知识来理解并传播特定生物过程,以助其在各类疾病情境中制定预防策略与治疗决策。人工智能(AI)的一项挑战性情境是利用生物医学数据(如文本、影像、组学与临床)为癌症状况提供诊断与治疗建议。有关癌症、药物、基因、蛋白质等生物医学实体及其机制的资料与知识散布于结构化(知识库(KBs))与非结构化(如科学文献)来源中。通过整合与抽取语义互相关联的实体与关系事实,可构建大规模知识图谱(KG)。此类 KG 不仅支持探索与问答(QA),亦使领域专家能推导新知识。然而,因缺乏对数据资产与语义技术的理解,非领域用户探索与查询大规模 KG 颇为繁琐。本文开发一领域 KG 以助力癌症特异性生物标志物发现与交互式 QA。为此,我们构建称为 OncoNet 本体(ONO)的领域本体,其支持用于验证基因-疾病(各类癌症)关系的语义推理。该 KG 进一步通过调和 ONO、元数据、受控词表及来自科学文献的生物医学概念而丰富,所用信息抽取器基于 BioBERT 与 SciBERT。此外,因生物医学领域不断演进,新发现常取代旧结论,若无法获取最新科学发现,AI 系统在提供诊断与治疗时极可能出现概念漂移。因此,我们基于较新文献与 KBs,利用大语言模型(LLMs)对 KG 进行微调。

关键词

引用

@article{arxiv.2310.08365,
  title  = {From Large Language Models to Knowledge Graphs for Biomarker Discovery in Cancer},
  author = {Md. Rezaul Karim and Lina Molinas Comet and Md Shajalal and Oya Deniz Beyan and Dietrich Rebholz-Schuhmann and Stefan Decker},
  journal= {arXiv preprint arXiv:2310.08365},
  year   = {2023}
}

备注

arXiv admin note: substantial text overlap with arXiv:2302.04737