FPGA 上的 HyperLogLog 草图加速
分布式、并行与集群计算
2020-10-21 v2
摘要
数据草图(data sketches)是一组广泛使用的近似数据汇总技术。其根本特性是针对输入基数的亚线性内存复杂度,这在处理具有庞大基域(URL、IP 地址、用户 ID 等)的流或数据集时十分重要。在众多可用的数据草图中,HyperLogLog 已成为基数计数(数据集中有多少不同数据项)的参考方法。尽管它不对每个数据项计数(以降低内存消耗),但它对结果提供概率性保证,因此常用于分析数据流。本文探讨如何在 FPGA 上实现 HyperLogLog,以利用可用并行性以及处理来自高速网络的数据流的能力。我们多流水线高基数 HyperLogLog 实现相比运行在双路 Intel Xeon E5-2630 v3 系统(共 16 核 32 超线程)上的优化 HyperLogLog 提供了 1.8 倍更高吞吐量。
引用
@article{arxiv.2005.13332,
title = {HyperLogLog Sketch Acceleration on FPGA},
author = {Amit Kulkarni and Monica Chiosa and Thomas B. Preußer and Kaan Kara and David Sidler and Gustavo Alonso},
journal= {arXiv preprint arXiv:2005.13332},
year = {2020}
}
备注
This paper was accepted as a full paper to FPL 2020. The latest/full version of this paper is available: https://ieeexplore.ieee.org/document/9221525