事实表排序与基于字对齐的位图索引压缩
数据库
2008-08-15 v3
摘要
位图索引常用于多维数据的索引。它们主要依赖顺序输入/输出。位图可被压缩以降低输入/输出成本并最小化 CPU 使用率。最高效的压缩技术基于游程编码(RLE),例如字对齐混合(WAH)压缩。此类压缩加速了位图上的逻辑运算(AND, OR)。然而,游程编码对事实的顺序敏感。因此,我们提出对事实表进行排序。我们回顾了字典序、格雷码和分块排序。我们发现字典序排序能改善压缩效果——有时生成的索引大小减半——并使索引速度提高数倍。虽然排序需要时间,但这部分被对已排序表进行索引速度更快这一事实所抵消。列的顺序至关重要:通常将具有更多不同值的列置于前面更为可取。分块排序的效率远低于完全排序。此外,我们发现在使用字对齐压缩时,格雷码排序并不优于字典序排序。
引用
@article{arxiv.0805.3339,
title = {Tri de la table de faits et compression des index bitmaps avec alignement sur les mots},
author = {Kamel Aouiche and Daniel Lemire and Owen Kaser},
journal= {arXiv preprint arXiv:0805.3339},
year = {2008}
}
备注
to appear at BDA'08