中文

VIP 哈希——动态适应数据热度偏斜(扩展版)

数据库 2022-06-27 v1

摘要

所有数据并非同等热门。通常,部分数据比其他数据被更频繁地访问,这导致数据项的热度出现偏斜。适应这种偏斜可以提升性能,过去针对基于磁盘的场景已对此课题进行了广泛研究。在本工作中,我们考虑一种内存数据结构,即哈希表,并展示如何利用热度偏斜来获得更高性能。哈希是一种低延迟操作,对缓存、分支预测和代码复杂度等因素的影响十分敏感。这些因素使得在环学习尤其具有挑战性,因为执行任何额外操作的开销都可能很显著。本文提出 VIP 哈希,一种完全在线的哈希表方法,它使用轻量级机制来学习热度偏斜并调整哈希表布局。这些机制是非阻塞的,其开销通过感知热度分布的变化来动态开启/关闭学习机制而得以控制。我们使用自研哈希测量工具 Wiscer 生成的多种工作负载测试了 VIP 哈希,发现它在存在偏斜时提升了性能(在具有一百万键的哈希表下,低偏斜时取操作吞吐量提升 22%,中偏斜时提升 77%),同时对插入、删除操作以及键的热度分布变化具有鲁棒性。我们发现,在中偏斜下,VIP 哈希将最昂贵的 TPC-H 查询即 TPC-H 查询 9 的端到端执行时间减少了 20%。

关键词

引用

@article{arxiv.2206.12380,
  title  = {VIP Hashing -- Adapting to Skew in Popularity of Data on the Fly (extended version)},
  author = {Aarati Kakaraparthy and Jignesh M. Patel and Brian P. Kroth and Kwanghyun Park},
  journal= {arXiv preprint arXiv:2206.12380},
  year   = {2022}
}