分布式学习优化 Cox 模型可能导致患者数据泄露:风险与对策
机器学习
2022-04-13 v1 密码学与安全
机器学习
摘要
医疗数据通常高度敏感,且经常存在缺失数据。由于数据的敏感性,人们有兴趣创建这样的建模方法:数据保留在各本地中心以保护隐私,但模型仍能在多个中心的数据上进行训练和学习。这种方法可能是分布式机器学习(联邦学习、协作学习),其中模型基于来自各中心的聚合本地模型信息迭代计算。然而,尽管没有具体数据离开中心,仍存在这样一种潜在风险:交换的信息足以重建全部或部分患者数据,这将损害分布式学习保护安全的基本理念。本文证明了 Cox 生存模型的优化可能导致患者数据泄露。随后,我们提出了一种以安全方式优化和验证 Cox 模型从而避免这些问题的方法。所提方法的可行性通过提供的 Matlab 代码得以展示,该代码还包含处理缺失数据的方法。
引用
@article{arxiv.2204.05856,
title = {Distributed learning optimisation of Cox models can leak patient data: Risks and solutions},
author = {Carsten Brink and Christian Rønn Hansen and Matthew Field and Gareth Price and David Thwaites and Nis Sarup and Uffe Bernchou and Lois Holloway},
journal= {arXiv preprint arXiv:2204.05856},
year = {2022}
}
备注
51 pages, 8 figures