基于高吞吐机器学习模型的电子健康记录敏感数据检测
密码学与安全
2023-05-23 v2 计算与语言
机器学习
摘要
在大数据时代,医疗提供者、社区与研究人员日益需要共享数据并开展协作,以改善健康结果、产生有价值的见解并推进研究。1996 年健康保险流通与责任法案(HIPAA)是一项联邦法律,旨在通过定义受保护健康信息(PHI)的法规来保护敏感健康信息。然而,它并未提供在数据共享前检测或移除 PHI 的高效工具。该研究领域面临的挑战之一是不同参与方数据中 PHI 字段的异质性。这种可变性使得在一个数据库上适用的基于规则的敏感变量识别系统在另一个数据库上失效。为解决此问题,我们的论文探索使用机器学习算法识别结构化数据中的敏感变量,从而促进去标识化过程。我们有一个关键观察:PHI 字段与非 PHI 字段的元数据分布差异很大。基于这一新发现,我们从原始特征的元数据中设计了超过 30 个特征,并使用机器学习构建分类模型以自动识别结构化电子健康记录(EHR)数据中的 PHI 字段。我们在来自不同数据源的多个大型 EHR 数据库上训练模型,发现我们的算法在检测未见数据集的 PHI 相关字段时达到 99% 准确率。我们研究的意义重大,可使处理敏感数据的行业受益。
引用
@article{arxiv.2305.03169,
title = {Sensitive Data Detection with High-Throughput Machine Learning Models in Electrical Health Records},
author = {Kai Zhang and Xiaoqian Jiang},
journal= {arXiv preprint arXiv:2305.03169},
year = {2023}
}
备注
Add fugire axis label