隐私保护统计数据生成:针对脓溶血检测的应用
机器学习
2024-04-26 v1 密码学与安全
摘要
医疗领域是受到人工智能 (AI) 日益增加的监管以及数据保护法规影响最大的部门之一,因患者信息的敏感性。然而,合成数据生成方法的兴起为数据驱动技术提供了可行的机遇。本研究提出了一种适用于分类问题的统计方法,用于合成数据生成。我们评估了基于核密度估计和 K 近邻抽样 (KDE-KNN) 生成的合成数据在实际应用中的实用性和隐私影响,具体聚焦于其在脓溶血检测中的应用。脓溶血检测是临床实践中的关键挑战,因为其快速进展且可能致命。此外,我们强调了 KDE-KNN 相对于当前合成数据生成方法的优势。此外,我们的研究还考察了将合成数据纳入模型训练程序中的效果。该调查为在医疗领域缓解监管约束的合成数据生成技术提供了有价值的见解。
引用
@article{arxiv.2404.16638,
title = {Privacy-Preserving Statistical Data Generation: Application to Sepsis Detection},
author = {Eric Macias-Fassio and Aythami Morales and Cristina Pruenza and Julian Fierrez},
journal= {arXiv preprint arXiv:2404.16638},
year = {2024}
}