中文

面向医疗与精准医学研究的可扩展数据科学平台

分布式、并行与集群计算 2018-08-16 v1

摘要

目的:(1)展示在大型学术医疗系统内基于开源技术构建的数据科学平台的实施;(2)描述基于该平台构建的两个计算医疗应用。材料与方法:部署了一个基于多种开源技术的数据科学平台,以支持实时大数据工作负载。使用 Java 和 Python 开发了用于 Apache Storm 和 NiFi 的数据采集工作流,以捕获患者监测和实验室数据用于下游分析。结果:将新兴数据管理方法以及 Hadoop 等开源技术结合,可用于创建集成数据湖以存储大型实时数据集。该基础设施还提供了一个稳健的分析平台,可在近实时下分析医疗与生物医学研究数据,用于精准医学和计算医疗用例。讨论:集成数据科学平台的实施与使用,使组织有机会将传统数据集(包括来自电子健康记录的数据)与新兴大数据源(如连续患者监测和实时实验室结果)相结合。这些平台能够为精准医学计划所需的关键信息提供经济高效且可扩展的分析。结论:能够利用数据科学平台中技术进展的组织,将有机会为计算医疗和精准医学研究提供对医疗数据的全面访问。

关键词

引用

@article{arxiv.1808.04849,
  title  = {A Scalable Data Science Platform for Healthcare and Precision Medicine Research},
  author = {Jacob McPadden and Thomas JS Durant and Dustin R Bunch and Andreas Coppi and Nathan Price and Kris Rodgerson and Charles J Torre and William Byron and H Patrick Young and Allen L Hsiao and Harlan M Krumholz and Wade L Schulz},
  journal= {arXiv preprint arXiv:1808.04849},
  year   = {2018}
}

备注

8 pages, 4 figures, 1 table