中文

关联知识文章与电子健康记录的高通量关系抽取算法开发

机器学习 2020-09-09 v1 机器学习

摘要

目的:医学关系是医疗人工智能所需的医学知识图的核心组成部分。然而,传统算法开发过程对专家标注的要求为挖掘新关系造成了主要瓶颈。本文提出 Hi-RES,一个用于高通量关系抽取算法开发的框架。我们还展示了将知识文章与电子健康记录(EHRs)相结合可显著提升分类准确率。方法:我们利用从结构化数据库和半结构化网页获得的关系三元组,将目标语料中的句子标注为正训练样本。还提供了两种通过将正样本与朴素负样本结合来创建改进负样本的方法。我们提出一个通用模型,使用大规模预训练语言模型和多实例注意力来汇总句子信息,再与从 EHRs 训练得到的概念嵌入连接用于关系预测。结果:我们应用 Hi-RES 框架开发了疾病-疾病关系和疾病-部位关系的分类算法。数百万句子被创建为训练数据。单独使用预训练语言模型和基于 EHR 的嵌入均比先前模型带来可观的准确率提升。将二者结合进一步将两组关系的准确率大幅提升至 0.947 和 0.998,分别比先前模型高 10-17 个百分点。结论:Hi-RES 是一个实现高通量且准确的关系抽取算法开发的高效框架。

关键词

引用

@article{arxiv.2009.03506,
  title  = {High-throughput relation extraction algorithm development associating knowledge articles and electronic health records},
  author = {Yucong Lin and Keming Lu and Yulin Chen and Chuan Hong and Sheng Yu},
  journal= {arXiv preprint arXiv:2009.03506},
  year   = {2020}
}