中文

DataSHIELD 中的深度生成模型

机器学习 2020-03-18 v1 密码学与安全 机器学习

摘要

从医疗数据计算统计量的最佳方式是使用个体患者数据。在某些情况下,由于隐私限制,此类数据难以获取。例如在德国,未经患者同意,无法将不同医院的常规数据汇总用于研究。DataSHIELD 软件为分布式数据的联合分析提供了基础设施与一组统计方法。其所含算法被重新表述以使用参与站点的聚合数据而非个体数据。若所需算法未在 DataSHIELD 中实现或无法如此重构,使用人工数据是一种替代方案。我们提出一种基于 DataSHIELD 构建、能保留分布式个体患者数据中复杂模式的人工数据生成方法与软件实现。这些与真实患者无关联的人工患者数据集随后可用于联合分析。我们使用深度玻尔兹曼机(DBMs)作为生成模型以捕捉数据分布。实现中,我们采用 Julia 编程语言的“BoltzmannMachines”包,并将其封装以用于基于 R 的 DataSHIELD。作为示例应用,我们在模拟遗传变异数据的合成数据集上用 DBMs 进行分布式分析。利用虚拟患者的层次聚类,可从人工数据中恢复原始数据的模式,证明了该方案的可行性。我们的实现为 DataSHIELD 增添了生成可用于多种分析(例如用深度学习进行模式识别)的人工数据的能力。这也更一般地展示了 DataSHIELD 如何能灵活扩展来自 R 以外语言的高级算法。

关键词

引用

@article{arxiv.2003.07775,
  title  = {Deep generative models in DataSHIELD},
  author = {Stefan Lenz and Harald Binder},
  journal= {arXiv preprint arXiv:2003.07775},
  year   = {2020}
}

备注

13 pages, 4 figures