Med7:一种用于电子健康记录的可迁移临床自然语言处理模型
计算与语言
2020-04-27 v2 信息检索
机器学习
摘要
自深度学习模型引入以来,临床自然语言处理领域已取得显著进展。自监督表示学习与迁移学习范式已成为许多自然语言处理应用的首选方法,尤其是在缺乏高质量人工标注数据的场景中。电子健康记录系统无处不在,大多数患者数据如今以电子形式、特别是自由文本形式被收集。医学概念的识别与信息抽取是一项具有挑战性的任务,却是将从非结构化数据解析为结构化表格格式以用于下游分析任务的重要基础。在本工作中,我们介绍了一个用于临床自然语言处理的命名实体识别模型。该模型被训练用于识别七类实体:药物名称、给药途径、频率、剂量、强度、剂型、持续时间。模型首先通过使用来自 MIMIC-III 语料的 200 万份自由文本患者记录预测下一个词进行自监督预训练,然后在命名实体识别任务上微调。该模型在所有七类上的宽松(严格)微平均 F1 分数达到 0.957(0.893)。此外,我们使用来自美国重症监护病房的数据对所开发模型的迁移能力进行了评估,目标为英国二级保健心理健康记录(CRIS)。将训练好的 NER 模型直接应用于 CRIS 数据导致性能下降至 F1=0.762,但在 CRIS 的小样本上微调后,模型取得了 F1=0.944 的合理性能。这表明,尽管数据集与 NER 任务之间高度相似,仍须在目标领域数据上微调以获得更准确的结果。
引用
@article{arxiv.2003.01271,
title = {Med7: a transferable clinical natural language processing model for electronic health records},
author = {Andrey Kormilitzin and Nemanja Vaci and Qiang Liu and Alejo Nevado-Holgado},
journal= {arXiv preprint arXiv:2003.01271},
year = {2020}
}
备注
16 pages, 1 figure, 15 tables