中文

云计算环境下用于文本分类与洞察挖掘的 COVID-19 开放研究数据集高性能处理

分布式、并行与集群计算 2020-09-17 v1

摘要

COVID-19 全球大流行是一场前所未有的健康危机。自疫情暴发以来,全球众多研究者产出了大量文献。为了让研究界和公众能够消化这些文献,及时分析文本并提供洞察至关重要,而这需要相当可观的计算能力。近年来,云计算在学术界和工业界已被广泛采用。尤其是混合云因其双重优势而日益流行:利用现有资源以节省成本,并使用额外的云服务提供商按需获取额外计算资源。在本文中,我们开发了一个系统,利用具有并行处理与多云能力的 Aneka PaaS 中间件,在混合云上借助机器学习技术加速 ETL 与文章分类流程。随后结果被持久化以供进一步引用、检索与可视化。我们的性能评估表明,该系统有助于缩短处理时间并实现线性可扩展性。除 COVID-19 外,该应用还可直接用于更广泛的学术文章索引与分析。

关键词

引用

@article{arxiv.2009.07399,
  title  = {High-Performance Mining of COVID-19 Open Research Datasets for Text Classification and Insights in Cloud Computing Environments},
  author = {Jie Zhao and Maria A. Rodriguez and Rajkumar Buyya},
  journal= {arXiv preprint arXiv:2009.07399},
  year   = {2020}
}