利用循环神经网络对患者病历进行去标识化
计算与语言
2016-06-14 v1 人工智能
神经与进化计算
机器学习
摘要
目的:电子健康记录(EHRs)中的患者病历可能包含医学研究的关键信息。然而,为了保护患者的机密性,绝大多数医学研究人员只能访问去标识化的病历。在美国,《健康保险流通与责任法案》(HIPAA)定义了18类受保护健康信息(PHI),需要将其移除以对病历进行去标识化。鉴于 EHR 数据库的规模、可访问非去标识化病历的研究人员数量有限以及人工标注者的频繁失误,人工去标识化是不切实际的。因此,一个可靠的自动化去标识化系统将具有很高的价值。材料与方法:我们引入了首个基于人工神经网络(ANNs)的去标识化系统,与现有系统不同,它不需要手工特征或规则。我们在两个数据集上将该系统的性能与 state-of-the-art 系统进行比较:i2b2 2014 去标识化挑战数据集(这是最大的公开可用去标识化数据集)和 MIMIC 去标识化数据集(我们组装的数据集,规模是 i2b2 2014 数据集的两倍)。结果:我们的 ANN 模型优于 state-of-the-art 系统。它在 i2b2 2014 数据集上的 F1 分数为 97.85(召回率 97.38,精确率 97.32),在 MIMIC 去标识化数据集上的 F1 分数为 99.23(召回率 99.25,精确率 99.06)。结论:我们的研究结果支持使用 ANN 对患者病历进行去标识化,因为它们表现出比以往已发表系统更好的性能,同时不需要特征工程。
引用
@article{arxiv.1606.03475,
title = {De-identification of Patient Notes with Recurrent Neural Networks},
author = {Franck Dernoncourt and Ji Young Lee and Ozlem Uzuner and Peter Szolovits},
journal= {arXiv preprint arXiv:1606.03475},
year = {2016}
}