中文

基于 Apache Spark 的 COVID-19 大规模生成数据多维存储系统

数据库 2020-05-12 v1 分布式、并行与集群计算

摘要

正在流行的冠状病毒病(COVID-19)于2019年12月在中国武汉爆发。COVID-19由一种此前未在人类中发现的新型病毒引起。随后该传染病在全球范围内广泛且快速地传播。每天,确诊病例数迅速增加,基于该病伴随的症状疑似病例数增加,不幸的是死亡人数也在增加。因此,随着全球病例数量的增多,管理这些处于不同状况(患者是确诊受伤还是出现何种症状的疑似)的病例信息变得困难。因此,迫切需要构建一个多维系统来存储和分析所生成的大规模数据。本文提出一种使用 Apache Spark 的 COVID-19 综合存储系统(CSS-COVID),以处理并管理因 COVID-19 每日数量增长所带来的问题。CSS-COVID有助于减少查询和存储 COVID-19 每日数据的处理时间。CSS-COVID包含三个阶段,即插入与索引、存储和查询阶段。在插入阶段,数据被划分为子集然后分别对每个子集建立索引。存储阶段使用一组存储节点来存储数据,而查询阶段负责处理查询过程。在 CSS-COVID 中使用 Apache Spark 提升了处理每日增加的冠状病毒病感染者大规模数据的性能。使用真实 COVID-19 数据集进行了一组实验,以证明 CSS-COVID 在索引大规模数据方面的效率。

关键词

引用

@article{arxiv.2005.05036,
  title  = {A Multi-Dimensional Big Data Storing System for Generated COVID-19 Large-Scale Data using Apache Spark},
  author = {Manar A. Elmeiligy and Ali I. El Desouky and Sally M. Elghamrawy},
  journal= {arXiv preprint arXiv:2005.05036},
  year   = {2020}
}