中文

利用通用与领域特定深度学习模型从医学文本中抽取 UMLS 概念

计算与语言 2019-10-04 v1 神经与进化计算

摘要

实体识别是诸多临床自然语言处理(NLP)应用(如实体链接与关系抽取)的关键第一步。我们首次尝试在新发布的数据集 MedMentions 上应用最先进的实体识别方法。该数据集包含超过 4000 篇生物医学摘要,标注了 UMLS 语义类型。与现有数据集相比,MedMentions 包含远更多的实体类型,因而代表了真实场景中更具挑战性但更现实的设定。我们探究了多个相关维度,包括上下文与非上下文词嵌入的使用、通用与领域特定的无监督预训练,以及不同的深度学习架构。我们将结果与著名的 i2b2 2010 实体识别数据集进行对比,并提出了一种融合通用与领域特定信息的新方法。尽管我们在 i2b2 2010 任务上取得了最先进的结果(F1 = 0.90),我们在 MedMentions 上的结果显著更低(F1 = 0.63),表明在该新数据上仍有大量改进空间。

关键词

引用

@article{arxiv.1910.01274,
  title  = {Extracting UMLS Concepts from Medical Text Using General and Domain-Specific Deep Learning Models},
  author = {Kathleen C. Fraser and Isar Nejadgholi and Berry De Bruijn and Muqun Li and Astha LaPlante and Khaldoun Zine El Abidine},
  journal= {arXiv preprint arXiv:1910.01274},
  year   = {2019}
}

备注

11 pages, accepted at LOUHI2019 workshop