中文

基于 Apache Spark 的大规模文本处理流水线

计算与语言 2019-12-03 v1 分布式、并行与集群计算 机器学习

摘要

在本文中,我们针对数据密集型的机器学习问题评估 Apache Spark。我们的用例聚焦于随时间推移美国各州立法机构间的政策扩散检测。先前关于政策扩散的研究由于计算强度而无法在法案间进行全配对比较。作为替代,学者们研究了单一主题领域。我们提供该分析工作流的一种实现,作为带有 Spark 数据框和 Scala 应用程序编程接口的分布式文本处理流水线。我们讨论了非结构化数据处理的挑战与策略、用于存储和高效访问的数据格式,以及大规模图处理。

关键词

引用

@article{arxiv.1912.00547,
  title  = {Large-scale text processing pipeline with Apache Spark},
  author = {Alexey Svyatkovskiy and Kosuke Imai and Mary Kroeger and Yuki Shiraito},
  journal= {arXiv preprint arXiv:1912.00547},
  year   = {2019}
}