中文

面向疾病基因优先排序的生物医学信息抽取

机器学习 2020-11-13 v2 计算与语言

摘要

我们引入一个从文本中抽取生物学关系的生物医学信息抽取(IE)流水线,并证明其组件(如命名实体识别(NER)与关系抽取(RE))在 BioNLP 上优于最先进水平。我们将其应用于数千万篇 PubMed 摘要以抽取蛋白质-蛋白质相互作用(PPIs),并将这些抽取结果增补到一个已包含从领先结构化 PPI 数据库 STRING 抽取的 PPIs 的生物医学知识图谱。我们展示,尽管图谱已包含来自成熟结构化来源的 PPIs,将我们基于 IE 的抽取结果增补至图谱可使我们预测新的疾病-基因关联时在 hit@30 上获得 20% 的相对提升,这是朝向为未治愈疾病开发药物靶标的重要一步。

关键词

引用

@article{arxiv.2011.05188,
  title  = {Biomedical Information Extraction for Disease Gene Prioritization},
  author = {Jupinder Parmar and William Koehler and Martin Bringmann and Katharina Sophia Volz and Berk Kapicioglu},
  journal= {arXiv preprint arXiv:2011.05188},
  year   = {2020}
}

备注

4th Knowledge Representation and Reasoning Meets Machine Learning Workshop (KR2ML), at NeurIPS 2020