面向非 IID 临床数据的隐私保护心脏病预测的联邦proximal优化:受控仿真研究
机器学习
2026-01-27 v1 人工智能
摘要
医疗机构拥有可为改进诊断模型提供帮助的宝贵患者数据,但隐私法规如 HIPAA 和 GDPR 防止医院相互共享原始数据。联邦学习通过在无需集中原始患者数据的情况下促进协作模型训练,为解决这一问题提供了途径。然而,临床数据集天然具有由人口统计差异和疾病患病率以及机构实践差异导致的非 IID(非独立同分布)特征。本文针对心脏病预测基于 UCI 心脏病数据集,对联邦proximal优化 (FedProx) 进行全面仿真研究。我们通过在克利夫兰诊所数据集(303 名患者)中模拟四个异构医院客户端,通过基于人口统计的分层诱导统计异质性,生成真实的非 IID 数据分区。我们的实验结果显示,FedProx 以 proximal 参数 mu=0.05 achieves 85.00% 的准确率,这优于集中学习 (83.33%) 和没有泄露患者隐私的孤立本地模型 (78.45% 平均值)。通过对 50 次独立运行进行大胆的 ablation 研究和统计验证,我们证明了在异构环境中proximal 正则化在抑制客户端漂移方面是有效的。这一概念证明研究为实际医疗保健系统提供了算法见解和实际部署指南,因此我们的结果直接可移植于医院 IT 管理员,实施隐私保护的协作学习。
引用
@article{arxiv.2601.17183,
title = {Federated Proximal Optimization for Privacy-Preserving Heart Disease Prediction: A Controlled Simulation Study on Non-IID Clinical Data},
author = {Farzam Asad and Junaid Saif Khan and Maria Tariq and Sundus Munir and Muhammad Adnan Khan},
journal= {arXiv preprint arXiv:2601.17183},
year = {2026}
}
备注
27 pages, 7 figures, 4 tables