面向疾病基因优先排序的生物医学信息抽取
机器学习
2020-11-13 v2 计算与语言
摘要
我们引入一个从文本中抽取生物学关系的生物医学信息抽取(IE)流水线,并证明其组件(如命名实体识别(NER)与关系抽取(RE))在 BioNLP 上优于最先进水平。我们将其应用于数千万篇 PubMed 摘要以抽取蛋白质-蛋白质相互作用(PPIs),并将这些抽取结果增补到一个已包含从领先结构化 PPI 数据库 STRING 抽取的 PPIs 的生物医学知识图谱。我们展示,尽管图谱已包含来自成熟结构化来源的 PPIs,将我们基于 IE 的抽取结果增补至图谱可使我们预测新的疾病-基因关联时在 hit@30 上获得 20% 的相对提升,这是朝向为未治愈疾病开发药物靶标的重要一步。
引用
@article{arxiv.2011.05188,
title = {Biomedical Information Extraction for Disease Gene Prioritization},
author = {Jupinder Parmar and William Koehler and Martin Bringmann and Katharina Sophia Volz and Berk Kapicioglu},
journal= {arXiv preprint arXiv:2011.05188},
year = {2020}
}
备注
4th Knowledge Representation and Reasoning Meets Machine Learning Workshop (KR2ML), at NeurIPS 2020