中文

Spark 中布隆过滤连接的最优参数

分布式、并行与集群计算 2017-06-13 v2 数据库

摘要

在本文中,我们提出了一种算法,该算法在分布式环境中使用最优大小的 Bloom 过滤器高效地连接关系数据库表。我们建议不使用以往研究中的固定大小 Bloom 过滤器,而是通过建立连接算法的数学模型,然后使用传统数学优化方法寻找 Bloom 过滤器的最优大小,从而找到最优参数。这种具有最优参数的算法不仅在星型连接上,而且在传统数据库模式上,都击败了以前使用 Bloom 过滤器的方法和默认的 SparkSQL 引擎。实验是在存储于分布式文件系统上作为 parquet 文件的标准 TPC-H 数据库上进行的。

关键词

引用

@article{arxiv.1706.02785,
  title  = {Optimal parameters for bloom-filtered joins in Spark},
  author = {Ophir Lojkine},
  journal= {arXiv preprint arXiv:1706.02785},
  year   = {2017}
}

备注

The article is in Russian, but an analysis of the data used in it is available in english at the following address: https://github.com/lovasoa/spark-bloomfiltered-join-analysis/blob/master/analysis.ipynb