中文

面向计算表型分析的联邦张量分解

机器学习 2017-10-13 v1 机器学习

摘要

张量分解模型提供了一种有效方法,将大规模电子健康记录转换为用于数据分析的有意义的临床概念(表型,phenotypes)。这些模型需要大量多样化样本以避免人群偏差。一个开放的挑战是如何在多家医院间联合推导表型,其中直接的患者级数据共享是不可能的(例如由于机构政策)。本文中,我们开发了一种新颖解决方案,能够在不共享患者级数据的情况下实现用于计算表型分析的联邦张量分解。我们基于交替方向乘子法(alternating direction method of multipliers,ADMM)开发了安全数据协调与联邦计算流程。使用该方法,多家医院迭代更新张量并将安全汇总信息传输至中央服务器,服务器聚合信息以生成表型。我们利用真实医疗数据集证明,我们的方法在准确性和表型发现方面类似于集中式训练模型(基于合并数据集),同时尊重隐私。

关键词

引用

@article{arxiv.1704.03141,
  title  = {Federated Tensor Factorization for Computational Phenotyping},
  author = {Yejin Kim and Jimeng Sun and Hwanjo Yu and Xiaoqian Jiang},
  journal= {arXiv preprint arXiv:1704.03141},
  year   = {2017}
}