中文

面向多医院数据的去中心化、协作式与隐私保护机器学习

机器学习 2024-04-30 v2 密码学与安全

摘要

机器学习(ML)已展现出在医疗数据分析方面的巨大潜力。从不同来源和环境收集的大规模数据集对于医疗领域的 ML 模型实现更好的准确性和泛化能力至关重要。由于复杂且各异的隐私和监管要求,跨不同医疗机构共享数据具有挑战性。因此,允许多方利用各自可用的私有数据集协作训练 ML 模型,而无需直接共享这些数据集或在协作中损害数据集隐私,这既困难又至关重要。在本文中,我们通过提出面向多医院数据的去中心化、协作式与隐私保护 ML(DeCaPH)来解决这一挑战。它提供以下关键优势:(1)允许不同方协作训练 ML 模型而无需传输其私有数据集;(2)通过限制训练过程中跨方共享任何内容所导致的潜在隐私泄露来保护患者隐私;(3)无需依赖中心化服务器即可促进 ML 模型训练。我们在三个不同任务上使用真实世界的分布式医疗数据集展示了 DeCaPH 的泛化能力和效能:使用电子健康记录进行患者死亡率预测、使用单细胞人类基因组进行细胞类型分类,以及使用胸部放射影像进行病理识别。我们证明,使用 DeCaPH 框架训练的 ML 模型具有改善的效用-隐私权衡,表明它能使模型在保持训练数据点隐私的同时具有良好的性能。此外,使用 DeCaPH 框架训练的 ML 模型总体上优于仅使用来自各方的私有数据集训练的模型,表明 DeCaPH 增强了模型的泛化能力。

关键词

引用

@article{arxiv.2402.00205,
  title  = {Decentralised, Collaborative, and Privacy-preserving Machine Learning for Multi-Hospital Data},
  author = {Congyu Fang and Adam Dziedzic and Lin Zhang and Laura Oliva and Amol Verma and Fahad Razak and Nicolas Papernot and Bo Wang},
  journal= {arXiv preprint arXiv:2402.00205},
  year   = {2024}
}

备注

page 6 and 12, typos corrected. Results unchanged