中文

PanJoin:一种基于分区的自适应流连接

数据库 2018-11-14 v1

摘要

在流处理中,流连接是性能瓶颈的关键来源之一。基于滑动窗口的流连接提供精确结果但消耗大量计算资源。当前方案缺乏对大窗口上连接谓词的支持。这些算法及其硬件加速器要么局限于等值连接,要么使用嵌套循环连接处理所有请求。本文提出一种称为 PanJoin 的新算法,该算法在大窗口上具有高吞吐量并支持等值连接与非等值连接。PanJoin 实现了三种新数据结构以在流连接的探测阶段减少计算。我们还在 FPGA 上实现了最适于硬件的数据结构 BI-Sort。我们的评估表明 PanJoin 比若干近期提出的流连接方法性能高出 1000 倍以上,并且对高度倾斜的数据也有良好适应性。

关键词

引用

@article{arxiv.1811.05065,
  title  = {PanJoin: A Partition-based Adaptive Stream Join},
  author = {Fei Pan and Hans-Arno Jacobsen},
  journal= {arXiv preprint arXiv:1811.05065},
  year   = {2018}
}