用于功能磁共振成像的大数据 Spark 解决方案
分布式、并行与集群计算
2016-03-24 v1 计算机与社会
摘要
近来,大数据应用已迅速扩展到不同行业。医疗保健也是愿意使用大数据平台的行业之一,因此一些大数据分析工具已在一定程度上被采用。作为诊断医疗保健支柱的医学成像处理大量的数据收集与处理。使用多种医学成像模态以不同形式和分辨率获取了大量 3D 和 4D 图像。预处理和分析成像数据目前是一个漫长且耗费成本和时间的过程。然而,由于数据格式等限制,为医学成像目的提供或重新设计的大数据平台并不多。在本文中,我们设计、开发并成功测试了用于医学成像数据(特别是功能磁共振成像——fMRI)的新流水线,该流水线使用单节点上的大数据 Spark / PySpark 平台,允许我们读取和加载成像数据,将其转换为弹性分布式数据集(Resilient Distributed Datasets)以便并行操作和执行内存数据处理,并将最终结果转换为成像格式,同时该流水线提供将结果存储为其他格式(如数据框)的选项。使用这一新方案和流水线,我们重复了先前的工作,其中我们使用模板匹配和平方差之和(SSD)方法从 fMRI 数据中提取脑网络。最终结果表明,我们基于 Spark (PySpark) 的解决方案在单节点上相比先前用 Python 开发的工作将性能(在处理时间方面)提高了约 4 倍。
引用
@article{arxiv.1603.07064,
title = {Big Data Spark Solution for Functional Magnetic Resonance Imaging},
author = {Saman Sarraf and Mehdi Ostadhashem},
journal= {arXiv preprint arXiv:1603.07064},
year = {2016}
}
备注
4 pages, IEEE EMBS 2016 ORLANDO