基于 SpaCy 轻松擦除病历中的敏感受保护健康信息——可扩展模型实现比较
机器学习
2019-06-18 v1 密码学与安全
机器学习
摘要
临床记录的去标识化是一个极为重要的过程,它使得记录中丰富的信息得以被利用。现有许多可用技术,但尚无方法实现评估过可扩展性这一重要基准。我们在性能和效率两方面评估了多种深度学习技术,如 BiLSTM-CNN、IDCNN、CRF、BiLSTM-CRF、SpaCy 等。我们提出,相较于其他已发表模型,用于从病历中擦除敏感 PHI(受保护健康信息)数据的 SpaCy 模型实现既表现良好又极为高效。
引用
@article{arxiv.1906.06968,
title = {Scrubbing Sensitive PHI Data from Medical Records made Easy by SpaCy -- A Scalable Model Implementation Comparisons},
author = {Rashmi Jain and Dinah Samuel Anand and Vijayalakshmi Janakiraman},
journal= {arXiv preprint arXiv:1906.06968},
year = {2019}
}
备注
9 Pages, 7 Figures, 2 Tables