云计算环境下用于文本分类与洞察挖掘的 COVID-19 开放研究数据集高性能处理
分布式、并行与集群计算
2020-09-17 v1
摘要
COVID-19 全球大流行是一场前所未有的健康危机。自疫情暴发以来,全球众多研究者产出了大量文献。为了让研究界和公众能够消化这些文献,及时分析文本并提供洞察至关重要,而这需要相当可观的计算能力。近年来,云计算在学术界和工业界已被广泛采用。尤其是混合云因其双重优势而日益流行:利用现有资源以节省成本,并使用额外的云服务提供商按需获取额外计算资源。在本文中,我们开发了一个系统,利用具有并行处理与多云能力的 Aneka PaaS 中间件,在混合云上借助机器学习技术加速 ETL 与文章分类流程。随后结果被持久化以供进一步引用、检索与可视化。我们的性能评估表明,该系统有助于缩短处理时间并实现线性可扩展性。除 COVID-19 外,该应用还可直接用于更广泛的学术文章索引与分析。
引用
@article{arxiv.2009.07399,
title = {High-Performance Mining of COVID-19 Open Research Datasets for Text Classification and Insights in Cloud Computing Environments},
author = {Jie Zhao and Maria A. Rodriguez and Rajkumar Buyya},
journal= {arXiv preprint arXiv:2009.07399},
year = {2020}
}