中文

大规模医学影像数据集的可扩展、可复现且经济高效的处理

分布式、并行与集群计算 2024-08-28 v1 数据库

摘要

由于所需的高强度计算和数据吞吐量、采集数据的变异性以及相关的财务开销,整理、处理和合并来自全国性研究的大规模医学影像数据集是一项艰巨的任务。现有用于大规模数据整理、处理和存储的平台或工具难以在计算速度上达到适合研究目的的可行成本-规模比,要么太慢,要么太贵。此外,以团队驱动的方式管理和保持大规模数据处理的一致性也是一项艰巨的任务。我们设计了一种符合BIDS标准的方法,用于构建高效且稳健的大规模弥散加权和T1加权MRI数据处理流程,该方法兼容低成本、高效率的计算系统。我们的方法实现了对可处理数据的自动查询,并以一致且可复现的方式运行流程,具有长期稳定性,同时利用异构的低成本计算资源和存储系统进行高效处理和数据传输。我们展示了我们的组织结构如何实现半自动化数据处理流程的效率,并表明我们的方法在处理时间上与基于云的计算相当,而成本效益却高出近20倍。我们的设计实现了快速的数据吞吐速度和低延迟,减少了存储服务器和计算服务器之间的数据传输时间,平均传输速率达到0.60 Gb/s,而基于云的处理方法为0.33 Gb/s。我们工作流引擎的设计允许快速运行流程,同时保持适应新采集数据的灵活性。

关键词

引用

@article{arxiv.2408.14611,
  title  = {Scalable, reproducible, and cost-effective processing of large-scale medical imaging datasets},
  author = {Michael E. Kim and Karthik Ramadass and Chenyu Gao and Praitayini Kanakaraj and Nancy R. Newlin and Gaurav Rudravaram and Kurt G. Schilling and Blake E. Dewey and Derek Archer and Timothy J. Hohman and Zhiyuan Li and Shunxing Bao and Bennett A. Landman and Nazirah Mohd Khairi},
  journal= {arXiv preprint arXiv:2408.14611},
  year   = {2024}
}