一种由Spark ML驱动的面向基于深度学习的学术数据应用的预处理方法
分布式、并行与集群计算
2019-11-19 v1
摘要
大数据已在多个领域得到应用。科学文献与论文是文本大数据最大的来源之一。大型学术数据已以多种方式用于创建创新应用,如合作者发现、专家寻找和研究管理系统。随着先进机器与深度学习技术的出现,此类应用的准确性和新颖性已成倍提高。然而,在基于云的环境中开发用于学术应用的深度学习模型的最大挑战是,由于文本预处理耗时过长导致资源利用不足。本文提出了一种预处理流水线,利用Spark进行数据摄取,并利用Spark ML对预处理任务进行流水线化。所提工作的评估通过一项案例研究完成,该案例研究使用基于LSTM的文本摘要从任意研究的摘要生成标题或概要。所提方法(P3SAPP)的摄取、预处理和累计时间远低于常规方法(CA),这也体现为成本的降低。
引用
@article{arxiv.1911.07763,
title = {A Spark ML driven preprocessing approach for deep learning based scholarly data applications},
author = {Samiya Khan and Xiufeng Liu and Mansaf Alam},
journal= {arXiv preprint arXiv:1911.07763},
year = {2019}
}