中文

从非结构化数据集中通过文本挖掘识别并提取新颖疾病疗法

信息检索 2020-11-17 v1 计算与语言 机器学习

摘要

目的:我们旨在从非结构化文本源中学习疾病的潜在新颖疗法。更具体地,我们通过对口语文本结构进行简单推理来提取潜在治愈疾病的药物-疾病对。材料与方法:我们使用Google Cloud转写一档NPR广播节目的播客剧集。随后构建一条流水线系统地对文本进行预处理,以确保核心分类模型的输入质量,该模型输出至一系列后处理步骤以获得过滤结果。我们的分类模型本身使用在PubMed文本上预训练的语言模型。流水线的模块化特性使得通过在各阶段替换更高质量的组件,便于该领域未来的发展。作为验证手段,我们使用ROBOKOP——一个仅含已验证路径的医学知识图谱引擎——作为检查所提配对是否存在的真值源。对于ROBOKOP中未发现的所提配对,我们使用Chemotext提供进一步验证。结果:我们在ROBOKOP数据库中找到了30.4%的所提配对。例如,我们的模型成功识别出奥美拉唑可帮助治疗胃灼热。我们讨论了该结果的意义,并展示所提配对的一些示例。讨论与结论:我们的结果与现有知识源的一致表明朝着正确方向迈进了一步。鉴于我们框架的即插即用特性,可轻松添加、移除或修改部分以按需改进模型。我们讨论了结果并展示若干示例,指出这是一条具有进一步探索空间的新研究路线。尽管我们的方法最初面向广播播客转录文本,但其与输入无关,可应用于任何文本数据来源及任何感兴趣的问题。

关键词

引用

@article{arxiv.2011.07959,
  title  = {Text Mining to Identify and Extract Novel Disease Treatments From Unstructured Datasets},
  author = {Rahul Yedida and Saad Mohammad Abrar and Cleber Melo-Filho and Eugene Muratov and Rada Chirkova and Alexander Tropsha},
  journal= {arXiv preprint arXiv:2011.07959},
  year   = {2020}
}

备注

initial submission