中文

基于 SMOTETomek 与 FedProx 的差分隐私联邦学习在不平衡临床数据上的稳健管道

密码学与安全 2025-08-15 v1 人工智能 机器学习 软件工程

摘要

联邦学习(FL)是一种革命性的 approach,用于协作性健康研究,允许在保护患者隐私的前提下对分布式数据进行模型训练。FL 在结合差分隐私(DP)后能够提供正式的安全保证。然而,这些技术的集成引入了隐私与临床实用性之间的显著权衡,这一挑战又因医学数据集中常见的严重类别不平衡而进一步复杂化。本研究通过系统化的多阶段分析来解决这些相互关联的问题。实现了一个用于心血管风险预测的 FL 框架,初始实验表明标准方法在处理不平衡数据时表现不佳,召回率为零。为克服这一限制,我们首先在客户端层面集成了混合合成少数过采样技术与 Tomek 链接(SMOTETomek),成功开发出临床实用模型。随后,该框架针对非独立同分布(non-IID)数据进行了使用调优 FedProx 算法的优化。最终结果揭示了隐私预算(epsilon)与模型召回率之间存在明显的非线性权衡,优化后的 FedProx 持续优于标准 FedAvg。我们在隐私-实用性前沿识别到了一条明确的运作区域,在该区域下(epsilon=9.0),可实现强隐私保证,同时保持高水平的临床实用性(召回率>77%)。最终,我们的研究为创建可应用于真实世界异构医疗数据的有效、安全且准确的诊断工具提供了实用的方法论蓝图。

关键词

引用

@article{arxiv.2508.10017,
  title  = {A Robust Pipeline for Differentially Private Federated Learning on Imbalanced Clinical Data using SMOTETomek and FedProx},
  author = {Rodrigo Tertulino},
  journal= {arXiv preprint arXiv:2508.10017},
  year   = {2025}
}

备注

This is being prepared to be submitted to the Journal of the Brazilian Computer Society (JBCS), which is still under construction