面向协作式健康数据分析的隐私保护张量分解
机器学习
2019-11-04 v2 密码学与安全
机器学习
摘要
张量分解已被证明是一种用于计算表型分析的有效方法,其将海量电子健康记录(EHR)转换为简洁而有意义的临床概念。虽然将张量分解任务分发到本地站点可以避免直接数据共享,但仍需要交换可能泄露敏感患者信息的中间结果。因此,挑战在于如何在严格且有原则的隐私约束下联合分解张量,同时仍支持模型的可解释性。我们提出 DPFact,一种用于基于 EHR 的计算表型分析的隐私保护协作式张量分解方法。它将先进的隐私保护机制与协作学习相结合。医院可以保持其 EHR 数据库私密,同时通过共享差分隐私的中间结果协作学习有意义的临床概念。此外,DPFact 使用结构化稀疏项来解决异质患者群体问题。在我们的框架中,每家医院分解其本地张量,并每隔若干次迭代将带有输出扰动的中间结果发送给一个半可信服务器,由该服务器生成表型。在真实世界和合成数据集上的评估表明,在严格隐私约束下,我们的方法比最先进的基线方法更准确且通信效率更高。
引用
@article{arxiv.1908.09888,
title = {Privacy-Preserving Tensor Factorization for Collaborative Health Data Analysis},
author = {Jing Ma and Qiuchen Zhang and Jian Lou and Joyce C. Ho and Li Xiong and Xiaoqian Jiang},
journal= {arXiv preprint arXiv:1908.09888},
year = {2019}
}