面向医疗应用的多方计算隐私保护数据插值
密码学与安全
2024-05-30 v1 机器学习
摘要
处理机器学习中的缺失数据至关重要,但许多数据集因错误或无响应而存在空白。与简单但不足的逐条删除法不同,文献中提供了更为精细和有效的方法,从而提高了样本量和准确性。然而,这些方法需要访问整个数据集,这与数据分布在多个来源时存在隐私法规的要求相矛盾。尤其在医疗和医疗保健领域,这种访问会暴露患者的敏感信息。本研究针对使用安全多方计算处理敏感数据的隐私保护插值方法,使能够在不透露任何一方敏感信息的情况下进行安全计算。在本研究中,我们以隐私保护的方式实现了均值、中位数、回归和kNN插值方法。我们特别针对医疗和医疗保健领域进行了设计,考虑到保护患者数据这一重要性,在糖尿病数据集上进行了展示。对糖尿病数据集的实验验证了我们隐私保护插值方法的正确性,最大误差约为,与明文方法相当。我们还分析了方法在不同样本数量下的可扩展性,显示其适用于现实世界的医疗问题。我们的分析表明,所有方法都随样本数量线性扩展。除kNN外,所有方法的运行时间显示它们可以用于大数据集。
引用
@article{arxiv.2405.18878,
title = {Privacy Preserving Data Imputation via Multi-party Computation for Medical Applications},
author = {Julia Jentsch and Ali Burak Ünal and Şeyma Selcan Mağara and Mete Akgün},
journal= {arXiv preprint arXiv:2405.18878},
year = {2024}
}
备注
Submitted to IEEE International Conference on E-health Networking, Application & Services