中文

使用语言模型预训练的医疗命名实体识别模型

计算与语言 2020-01-30 v2 信息检索 机器学习

摘要

本文提出从非结构化电子健康记录(EHR)[2]中提取结构化信息的方法,该信息可用于例如研究患者因产品中化学物质导致的药物不良反应。我们的方案结合自然语言处理(NLP)技术与基于 Web 的标注工具,以优化在有限 EHR 训练数据上训练的定制命名实体识别(NER)[1]模型性能。该工作发表于首届健康搜索与数据挖掘研讨会(HSDM 2020)[26]。我们展示结合工具与技术,利用 NLP 近期进展,通过应用迁移学习与语言模型预训练技术[3]应对领域偏移。我们将自身技术与当前流行方法比较,展示 NER 模型性能的有效提升及标注数据时间的减少。结果中的一个关键观察是:仅使用 50% 可用训练数据、以我们的方法训练的模型 F1 分数(0.734)优于使用 100% 可用训练数据、不含语言模型组件的空白 spaCy 模型(0.704)。我们还展示一种标注工具,以最小化领域专家时间与生成此类训练集所需的手工工作量。此外,我们计划向社区发布标注数据集与预训练模型,以推进医疗健康记录研究。

关键词

引用

@article{arxiv.1910.11241,
  title  = {Healthcare NER Models Using Language Model Pretraining},
  author = {Amogh Kamat Tarcar and Aashis Tiwari and Vineet Naique Dhaimodker and Penjo Rebelo and Rahul Desai and Dattaraj Rao},
  journal= {arXiv preprint arXiv:1910.11241},
  year   = {2020}
}

备注

This work was presented at the first Health Search and Data Mining Workshop (HSDM 2020) as part of WSDM 2020 conference