EPIC:通过迭代协作增强隐私
机器学习
2024-11-11 v1 密码学与安全
摘要
基因组学技术的进步导致病毒(如 SARS-CoV-2)序列数据量不断增长,使得机器学习(ML)在生物信息学中的使用日益增加。传统 ML 技术需要集中式数据收集与处理,在实际医疗场景中面临挑战。此外,将医疗数据汇集到集中式存储中以训练强大的深度学习(DL)模型时,存在隐私、所有权和严格监管问题。联邦学习(FL)方法通过设置中心聚合服务器和共享全局模型来克服此类问题。它还通过在不暴露实际数据的情况下提取知识来促进数据隐私。本工作提出了一种前沿的通过迭代协作增强隐私(EPIC)架构。网络在本地服务器和中心服务器之间分布与共享。我们将 EPIC 方法应用于监督分类问题,以在不显式传输原始序列数据的情况下估计 SARS-CoV-2 基因组序列数据谱系。我们的目标是创建一个通用的去中心化优化框架,使各数据持有者能够协同工作并收敛至单一预测模型。结果表明,隐私保护策略可以与聚合方法成功结合,而不会实质性改变学习收敛程度。最后,我们指出了基于 FL 的方法在医疗应用中的一些潜在问题和研究前景。
引用
@article{arxiv.2411.05167,
title = {EPIC: Enhancing Privacy through Iterative Collaboration},
author = {Prakash Chourasia and Heramb Lonkar and Sarwan Ali and Murray Patterson},
journal= {arXiv preprint arXiv:2411.05167},
year = {2024}
}
备注
Accepted at SIMBig 2024