中文

用于快速匹配直方图的自适应采样

数据库 2018-05-09 v3

摘要

在探索性数据分析中,分析人员经常需要在大量候选直方图中识别具有特定分布的直方图,例如,找出收入分布与希腊最相似的国家。这种分布可能是用户好奇的新分布,也可能是现有直方图可视化中的已知分布。目前,这一识别过程是蛮力的,需要手动生成和评估大量直方图。我们提出了 FastMatch:一种端到端的方法,用于从大量直方图集合中交互式地检索与用户指定目标最相似的直方图可视化。FastMatch 背后的主要技术贡献是一种概率算法 HistSim,这是一种理论上可靠的基于采样的方法,用于在 1\ell_1 距离下识别前 kk 个最接近的直方图。虽然 HistSim 可以独立使用,但在 FastMatch 中,我们将 HistSim 与一种新颖的系统架构相结合,该架构意识到实际考虑因素,采用异步基于块的采样策略,并建立在最近开发轻量级采样引擎的基础上。FastMatch 在多个真实世界数据集上获得了近乎完美的准确性,与不使用采样的方法相比,速度提升了高达 35 倍。

关键词

引用

@article{arxiv.1708.05918,
  title  = {Adaptive Sampling for Rapidly Matching Histograms},
  author = {Stephen Macke and Yiming Zhang and Silu Huang and Aditya Parameswaran},
  journal= {arXiv preprint arXiv:1708.05918},
  year   = {2018}
}