中文

用于知识图谱构建的生物医学关系抽取方法与模型比较

人工智能 2024-07-09 v4 计算与语言 信息检索 机器学习

摘要

生物医学研究正以指数级速度增长,以至于科学家、研究人员与从业者不再能应对该领域所发表文献的数量。文献中呈现的知识需要被系统化为一种可轻松发现、访问与验证主张和假设的形式。知识图谱可提供这样一种从文献中进行语义知识表示的框架。然而,为构建知识图谱,有必要将知识抽取为生物医学实体间的关系,并对实体与关系类型进行规范化。本文中,我们提出并比较了几种基于规则与基于机器学习(Naive Bayes、Random Forests 作为传统机器学习方法示例,DistilBERT、PubMedBERT、T5 与基于 SciFive 的模型作为现代深度学习 transformer 示例)的方法,用于从生物医学文献中可扩展地抽取关系,并集成至知识图谱。我们考察了这些方法对不平衡且相当小数据集的鲁棒性。我们的实验表明,基于 transformer 的模型能很好处理小(由于在大型数据集上预训练)与不平衡数据集。表现最佳的模型是在平衡数据上微调的基于 PubMedBERT 的模型,F1 值为 0.92。基于 DistilBERT 的模型紧随其后,F1 值为 0.89,且速度更快、资源需求更低。基于 BERT 的模型表现优于基于 T5 的生成模型。

关键词

引用

@article{arxiv.2201.01647,
  title  = {Comparison of biomedical relationship extraction methods and models for knowledge graph creation},
  author = {Nikola Milosevic and Wolfgang Thielemann},
  journal= {arXiv preprint arXiv:2201.01647},
  year   = {2024}
}

备注

Paper submitted to Journal of Semantic Web