中文

遗传学中的联邦学习:准确性、性能与隐私权衡的扩展分析

机器学习 2025-05-26 v2 密码学与安全 基因组学

摘要

对大规模基因组或转录组数据进行机器学习对于许多新型健康应用至关重要。例如,精准医疗根据个体生物标志物、细胞和分子状态等为患者定制治疗方案。然而,所需数据具有敏感性、海量性、异质性,且通常分布在缺乏专用机器学习硬件的地区。由于隐私和监管原因,将所有数据聚合到受信任的第三方也存在问题。联邦学习是解决这一困境的有前景的方案,因为它能够在不交换原始数据的情况下实现去中心化的协作机器学习。本文使用 TensorFlow Federated 和 Flower 联邦学习框架进行了对比实验。我们的测试案例是疾病预后和细胞类型分类模型的训练。我们利用分布式转录组数据训练模型,同时考虑了数据异质性和架构异质性。我们测量了模型质量、针对隐私增强噪声的鲁棒性以及计算性能。我们从客户端和全局视角评估了联邦系统的资源开销,并分析了其优势与局限性。每个联邦学习框架各有优势。然而,我们的实验证实,两个框架均可在转录组数据上轻松构建模型,而无需将个人原始数据传输给拥有丰富计算资源的第三方。本文是 https://link.springer.com/chapter/10.1007/978-3-031-63772-8_26 的扩展版本。

关键词

引用

@article{arxiv.2402.14527,
  title  = {Federated Learning in Genetics: Extended Analysis of Accuracy, Performance and Privacy Trade-offs},
  author = {Anika Hannemann and Jan Ewald and Leo Seeger and Erik Buchmann},
  journal= {arXiv preprint arXiv:2402.14527},
  year   = {2025}
}

备注

This paper is the extended version of https://link.springer.com/chapter/10.1007/978-3-031-63772-8_26