使用自然语言处理进行临床自由文本去标识化:当前方法的系统综述
计算与语言
2024-04-11 v1 人工智能
密码学与安全
数字图书馆
机器学习
摘要
背景:电子健康记录(EHRs)是数据驱动医疗研究的宝贵资源。然而,受保护健康信息(PHI)的存在使得EHRs不适合用于研究共享。去标识化,即去除PHI的过程,是使EHR数据可访问的关键步骤。自然语言处理已多次证明其在自动化去标识化过程中的可行性。目标:我们的研究旨在提供关于过去十三年中临床自由文本去标识化如何演变的系统性证据,并报告当前最先进系统的性能和局限性。此外,我们旨在识别该领域的挑战和潜在研究机会。方法:在PubMed、Web of Science和DBLP中进行了系统性检索,以查找2010年1月至2023年2月期间发表的研究。检查了标题和摘要以识别相关研究。然后对选定的研究进行了深入分析,并收集了关于去标识化方法、数据源和测量性能的信息。结果:共筛选出2125篇出版物的标题和摘要。发现69项研究相关。机器学习(37项研究)和混合(26项研究)方法占主导地位,而六项研究仅依赖规则。大多数方法在公开语料库上进行了训练和评估。2014年i2b2/UTHealth语料库使用最频繁(36项研究),其次是2006年i2b2(18项研究)和2016年CEGS N-GRID(10项研究)语料库。
引用
@article{arxiv.2312.03736,
title = {De-identification of clinical free text using natural language processing: A systematic review of current approaches},
author = {Aleksandar Kovačević and Bojana Bašaragin and Nikola Milošević and Goran Nenadić},
journal= {arXiv preprint arXiv:2312.03736},
year = {2024}
}
备注
Submitted to Artificial Intelligence in Medicine