基于大数据的Covid-19数据集复杂查询执行框架(COVID-QF)
数据库
2020-05-27 v1 分布式、并行与集群计算
摘要
Covid-19的快速全球传播推动了大数据分析的创新工具。这些工具指导卫生行业各领域组织追踪并最小化病毒影响。研究人员需要通过人工智能、机器学习和自然语言处理来检测冠状病毒,并全面了解该疾病。Covid-19发生于世界不同国家,只有大数据应用和NOSQL数据库的工作才适用。有大量用于处理NOSQL数据库模型的平台,如:Spark、H2O和Hadoop HDFS/MapReduce,它们适合控制和管理海量数据。大型应用程序员面临许多挑战,尤其是那些通过混合数据模型、不同API和查询在Covid-19数据库上工作的程序员。在此背景下,本文提出一个名为(COVID-QF)的存储框架来处理SQL和NOSQL数据库,用于Covid-19数据集,以通过减少处理时间来解决病毒全球传播所引起的问题。在NoSQL数据库情况下,COVID-QF使用Hadoop HDFS/Map Reduce和Apache Spark。COVID-QF由三层组成:数据收集层、存储层和查询处理层。数据在数据收集层收集。存储层将数据划分为数据保存和处理块集合,并将spark的连接器与不同数据库引擎连接以减少保存和检索时间。而处理层执行请求查询并发送结果。所提框架使用三个为Covid-19数据增加的时间数据集(COVID-19-Merging、COVID-19-inside-Hubei和COVID-19-ex-Hubei)来测试本研究的实验。所得结果证实了COVID-QF框架的优越性。
引用
@article{arxiv.2005.12271,
title = {A Big Data Based Framework for Executing Complex Query Over COVID-19 Datasets (COVID-QF)},
author = {Eman A. Khashan and Ali I. Eldesouky and M. Fadel and Sally M. Elghamrawy},
journal= {arXiv preprint arXiv:2005.12271},
year = {2020}
}