中文

基于本体驱动与弱监督的临床笔记罕见病识别

计算与语言 2023-05-04 v5

摘要

计算文本表型分析是从临床笔记中识别患有特定疾病与特征患者的实践。罕见病因可用于机器学习的病例稀少以及需要领域专家进行数据标注而难以识别。我们提出一种利用本体与弱监督、并结合来自双向 Transformer(如 BERT)的近期预训练上下文表示的方法。该基于本体的框架包含两步:(i)Text-to-UMLS,通过上下文将提及关联到统一医学语言系统(UMLS)中的概念来抽取表型,使用命名实体识别与链接(NER+L)工具 SemEHR,并以自定义规则和上下文提及表示进行弱监督;(ii)UMLS-to-ORDO,将 UMLS 概念匹配到 Orphanet 罕见病本体(ORDO)中的罕见病。所提弱监督方法旨在学习一个表型确认模型以改进 Text-to-UMLS 链接,且无需领域专家的标注数据。我们在三个临床数据集上评估该方法:MIMIC-III 出院小结、MIMIC-III 放射报告,以及来自英美两家机构的 NHS Tayside 脑成像报告,均带标注。精度提升显著(Text-to-UMLS 链接的绝对分数提升超 30% 至 50%),且与现有 NER+L 工具 SemEHR 相比几乎无召回损失。MIMIC-III 与 NHS Tayside 放射报告的结果与出院小结一致。处理临床笔记的整体流水线可抽取罕见病病例,其中多数未被结构化数据(人工分配的 ICD 编码)捕获。我们讨论了弱监督方法的效用并提出了未来研究方向。

关键词

引用

@article{arxiv.2205.05656,
  title  = {Ontology-Driven and Weakly Supervised Rare Disease Identification from Clinical Notes},
  author = {Hang Dong and Víctor Suárez-Paniagua and Huayu Zhang and Minhong Wang and Arlene Casey and Emma Davidson and Jiaoyan Chen and Beatrice Alex and William Whiteley and Honghan Wu},
  journal= {arXiv preprint arXiv:2205.05656},
  year   = {2023}
}

备注

Accepted for BMC Medical Informatics and Decision Making, structured abstract in full text, 16 pages, 4 figures (and extra 7 pages, 1 figure in the supplementary material)