中文

GERNERMED——一个开源的德语医学命名实体识别模型

计算与语言 2021-12-13 v2 人工智能 信息检索 机器学习

摘要

当前,结构良好的电子健康记录的采用以及将患者医疗数据以结构化格式存储的数字方法的整合,相较于传统的、基于非结构化文本的患者数据记录方式,常被认为处于落后状态。医疗数据分析领域的数据挖掘往往只能依赖处理非结构化数据来获取相关信息。在自然语言处理(NLP)中,统计模型已在词性标注、关系抽取(RE)和命名实体识别(NER)等多种任务中表现出成功。本工作中,我们提出 GERNERMED,这是第一个用于 NER 任务、专门检测德语文本数据中医学实体类型的开源神经 NLP 模型。在此,我们通过在由预训练神经机器翻译模型从公开外语数据集翻译而来的自定义数据集上训练模型,避免了保护敏感患者数据免遭训练数据提取与发布统计模型权重之间的目标冲突。示例代码与统计模型可在 https://github.com/frankkramer-lab/GERNERMED 获取。

关键词

引用

@article{arxiv.2109.12104,
  title  = {GERNERMED -- An Open German Medical NER Model},
  author = {Johann Frei and Frank Kramer},
  journal= {arXiv preprint arXiv:2109.12104},
  year   = {2021}
}