利用通用与领域特定深度学习模型从医学文本中抽取 UMLS 概念
计算与语言
2019-10-04 v1 神经与进化计算
摘要
实体识别是诸多临床自然语言处理(NLP)应用(如实体链接与关系抽取)的关键第一步。我们首次尝试在新发布的数据集 MedMentions 上应用最先进的实体识别方法。该数据集包含超过 4000 篇生物医学摘要,标注了 UMLS 语义类型。与现有数据集相比,MedMentions 包含远更多的实体类型,因而代表了真实场景中更具挑战性但更现实的设定。我们探究了多个相关维度,包括上下文与非上下文词嵌入的使用、通用与领域特定的无监督预训练,以及不同的深度学习架构。我们将结果与著名的 i2b2 2010 实体识别数据集进行对比,并提出了一种融合通用与领域特定信息的新方法。尽管我们在 i2b2 2010 任务上取得了最先进的结果(F1 = 0.90),我们在 MedMentions 上的结果显著更低(F1 = 0.63),表明在该新数据上仍有大量改进空间。
引用
@article{arxiv.1910.01274,
title = {Extracting UMLS Concepts from Medical Text Using General and Domain-Specific Deep Learning Models},
author = {Kathleen C. Fraser and Isar Nejadgholi and Berry De Bruijn and Muqun Li and Astha LaPlante and Khaldoun Zine El Abidine},
journal= {arXiv preprint arXiv:1910.01274},
year = {2019}
}
备注
11 pages, accepted at LOUHI2019 workshop