中文

MIMIC-III 上结合差分隐私的联邦学习方法探索性分析

机器学习 2023-02-09 v1 机器学习

摘要

背景:联邦学习方法提供了在难以共享的隐私敏感数据集上训练机器学习模型的可能性。多项法规对医疗数据的存储和使用提出了严格要求,导致数据处于孤岛状态(即锁定在医疗机构中)。在这些数据集上应用联邦算法可加速疾病诊断、药物开发并改善患者护理。方法:我们针对在开源 MIMIC-III 数据集上训练模型时不同联邦与差分隐私技术的影响进行了广泛评估。我们分析了一组影响联邦模型性能的参数,即数据分布(同构与异构)、通信策略(通信轮次 vs. 本地训练轮数)、联邦策略(FedAvg vs. FedProx)。此外,我们评估并比较了模型训练中的两种差分隐私(DP)技术:基于随机梯度下降的差分隐私算法(DP-SGD)与稀疏向量差分隐私技术(DP-SVT)。结果:我们的实验表明,站点间极端的数据分布(在患者数量或站点间正标签比例上的不平衡)在使用 FedAvg 策略训练时会导致模型性能下降。当使用 FedProx 并配合适当的超参数调优时,该问题得以解决。此外,结果表明两种差分隐私技术均可达到与无 DP 训练的模型相似的性能,但代价是可量化的较大隐私泄露。结论:我们从经验上评估了两种联邦策略的益处,并提出了使用差分隐私技术时参数选择的最优策略。

关键词

引用

@article{arxiv.2302.04208,
  title  = {Exploratory Analysis of Federated Learning Methods with Differential Privacy on MIMIC-III},
  author = {Aron N. Horvath and Matteo Berchier and Farhad Nooralahzadeh and Ahmed Allam and Michael Krauthammer},
  journal= {arXiv preprint arXiv:2302.04208},
  year   = {2023}
}