LMQ-Sketch:面向高速在线分析的 Lagom 多查询草图
数据结构与算法
2025-07-08 v2
摘要
数据草图在高容量、高速率数据中在资源效率与可控近似之间进行权衡,以提取特征。近期研究的两个重要关注点分别为:(1) 从单次遍历中回答多种类型的查询,(2) 与更新并发查询。将这些方向集成时会出现若干基本挑战,我们在此工作中对这些挑战进行了解决。我们研究了需要平衡的权衡,并将关键思想综合为 LMQ-Sketch,一种支持多种查询(频率点查询、频率矩 F1 和 F2)并与更新并发的单一复合数据草图。我们的方法 "Lagom" 是 LMQ-Sketch 实现低延迟全局查询 (<100 \us) 的核心,结合了新鲜度、时效性和准确性,同时具有低内存占用和高吞吐量 (>2B 更新/秒)。我们分析和评估了 Lagom 的准确性,该方法基于简单几何论证,并高效地将工作分布与同步结合,以实现 proper 并发语义 — 操作的单调性和中间值的线性一致性。与 state-of-the-art 方法(如前所述,仅覆盖混合查询或并发)进行比较,LMQ-Sketch 在吞吐量上表现出高度竞争力,同时提供额外的准确性保证和并发语义,还将所需内存预算降低了一个数量级。我们期望该方法的技术方法对并发多查询草图具有更广泛的影响。
引用
@article{arxiv.2506.16928,
title = {LMQ-Sketch: Lagom Multi-Query Sketch for High-Rate Online Analytics},
author = {Martin Hilgendorf and Marina Papatriantafilou},
journal= {arXiv preprint arXiv:2506.16928},
year = {2025}
}