中文

MedLeak:面向安全联邦学习的多模态医疗数据泄露攻击

机器学习 2025-07-01 v2 密码学与安全 图像与视频处理

摘要

联邦学习(FL)允许参与者在保持数据本地的同时协同训练机器学习模型,因而适用于医疗机构之间处理敏感数据的合作。然而,本文提出了一种新颖的隐私攻击方法MedLeak,使恶意FL服务器能够从客户模型更新中恢复高质量的特定于站点的私人医疗数据。MedLeak通过在FL训练过程中引入一个恶意精心设计的模型来工作。不知情的诚实客户继续遵循标准FL协议发送更新。利用一种新型分析方法,MedLeak可以高效地从聚合的参数更新中恢复私人客户数据,无需耗费昂贵的优化。此外,该方案仅依赖于聚合后的更新,因此使安全聚合协议无效,因为这些协议依赖于中间结果随机化来实现安全,而最终的聚合结果却保持不变。我们在医学图像数据集(MedMNIST、COVIDx CXR-4和Kaggle脑肿瘤MRI)以及医学文本数据集(MedAbstract)上实现了MedLeak。结果表明,该攻击在图像和文本数据集上实现了高恢复率和强有力的量化分数。我们还全面评估了MedLeak在不同攻击参数下的表现,提供了影响攻击性能和潜在防御的关键因素的见解。此外,我们证明恢复的数据可支持诸如疾病分类等下游任务,几乎不损失性能。我们的发现验证了在FL系统中加强隐私措施的必要性,特别是为了保护敏感医疗数据免受强大的模型反转攻击。

关键词

引用

@article{arxiv.2407.09972,
  title  = {MedLeak: Multimodal Medical Data Leakage in Secure Federated Learning with Crafted Models},
  author = {Shanghao Shi and Md Shahedul Haque and Abhijeet Parida and Chaoyu Zhang and Marius George Linguraru and Y. Thomas Hou and Syed Muhammad Anwar and Wenjing Lou},
  journal= {arXiv preprint arXiv:2407.09972},
  year   = {2025}
}

备注

Accepted by the IEEE/ACM conference on Connected Health: Applications, Systems and Engineering Technologies 2025 (CHASE'25)