基于本体与弱监督从临床笔记中识别罕见病
计算与语言
2021-07-30 v3
摘要
利用自然语言处理(NLP)从临床笔记中识别罕见病具有挑战性,原因在于可用于机器学习的病例极少,且需要临床专家进行数据标注。我们提出一种使用本体与弱监督的方法。该方法包括两步:(i)Text-to-UMLS,将文本提及链接到统一医学语言系统(UMLS)中的概念,使用命名实体链接工具(如 SemEHR)以及基于自定义规则和基于 Bidirectional Encoder Representations from Transformers(BERT)的上下文表示的弱监督;(ii)UMLS-to-ORDO,将 UMLS 概念匹配到 Orphanet 罕见病本体(ORDO)中的罕见病。以 MIMIC-III 美国重症监护出院小结为案例研究,我们表明 Text-to-UMLS 过程可借助弱监督大幅改进,而无需领域专家的任何标注数据。我们的分析显示,处理出院小结的整体流程可发掘罕见病病例,这些病例大多未被医院入院记录中的人工 ICD 编码所捕获。
引用
@article{arxiv.2105.01995,
title = {Rare Disease Identification from Clinical Notes with Ontologies and Weak Supervision},
author = {Hang Dong and Víctor Suárez-Paniagua and Huayu Zhang and Minhong Wang and Emma Whitfield and Honghan Wu},
journal= {arXiv preprint arXiv:2105.01995},
year = {2021}
}
备注
5 pages, 3 figures, accepted for IEEE EMBC 2021