中文

面向 Apache Spark 的零开销、Arrow 赋能数据接口

分布式、并行与集群计算 2021-11-30 v2

摘要

分布式数据处理生态系统广泛存在,其组件高度专业化,因此高效的互操作性十分迫切。近期,Apache Arrow 被社区选作格式中介,提供高效的内存数据表示。Arrow 实现了数据处理与存储引擎间的高效数据移动,显著改善了互操作性与整体性能。在本工作中,我们通过 Arrow Dataset API 设计了 Apache Spark 与基于 Arrow 的数据源之间新的零开销数据互操作层。我们的新型数据接口有助于分离计算(Spark)与数据(Arrow)层。这使实践者能够无缝使用 Spark 访问所有支持 Arrow Dataset API 的数据源与框架。为使社区受益,我们将工作开源,并表明通过 Apache Arrow 消费数据是零开销的:我们的新型数据接口性能与原生 Spark 持平或更优。

关键词

引用

@article{arxiv.2106.13020,
  title  = {Zero-Cost, Arrow-Enabled Data Interface for Apache Spark},
  author = {Sebastiaan Alvarez Rodriguez and Jayjeet Chakraborty and Aaron Chu and Ivo Jimenez and Jeff LeFevre and Carlos Maltzahn and Alexandru Uta},
  journal= {arXiv preprint arXiv:2106.13020},
  year   = {2021}
}

备注

6 pages, 6 figures