NEAR:临床概念的命名实体与属性识别
计算与语言
2022-08-31 v1
摘要
命名实体识别(NER)或从临床文本中抽取概念,是识别文本中实体并将其归入诸如问题、治疗、检查、临床科室、发生事件(如入院和出院)等类别的任务。NER 是构成处理并利用电子健康记录(EHR)中非结构化数据的关键组件。尽管识别概念的指代区间与类别本身已是具挑战性的任务,这些实体还可能带有诸如否定等属性,会扭转其所指实体对使用者的隐含意义。专门致力于同时识别实体及其限定属性的研究甚少。本研究希望通过将以属性分配标注序列标签的方式将 NER 任务建模为监督式多标签标注问题,来贡献于检测实体及其对应属性的领域。本文中,我们提出 3 种架构以实现此多标签实体标注:BiLSTM n-CRF、BiLSTM-CRF-Smax-TF 与 BiLSTM n-CRF-TF。我们在 2010 i2b2/VA 与 i2b2 2012 共享任务数据集上评估这些方法。我们的不同模型在 i2b2 2010/VA 与 i2b2 2012 上分别取得最佳 NER F1 分数 0.894 与 0.808。所获得的基于跨度的微观平均 F1 极性分数在 i2b2 2010/VA 与 i2b2 2012 数据集上分别为 0.832 与 0.836,所获得的宏观平均 F1 极性分数分别为 0.924 与 0.888。在 i2b2 2012 数据集上进行的模态研究显示出基于跨度的微观平均 F1 与宏观平均 F1 的高分数分别为 0.818 与 0.501。
引用
@article{arxiv.2208.13949,
title = {NEAR: Named Entity and Attribute Recognition of clinical concepts},
author = {Namrata Nath and Sang-Heon Lee and Ivan Lee},
journal= {arXiv preprint arXiv:2208.13949},
year = {2022}
}
备注
11 pages, 7 figures, 9 tables