面向网络文档集高效存储与检索的相对 Lempel-Ziv 分解
数据结构与算法
2015-03-19 v2 数据库
信息检索
摘要
支持快速随机访问的压缩技术是任何信息系统的核心组成部分。当前最先进的方法将文档分组为固定大小的块,并使用如 GZIP 等通用自适应算法压缩每个块。对特定文档的随机访问则需要解压整个块。块大小的选择至关重要:它在压缩效率与文档检索时间之间进行权衡。本文提出一种面向大型文档集的可扩展压缩方法,支持快速随机访问。我们构建文档集的一个代表性样本,并将其作为字典,以类似 LZ77 的编码方式对文档集其余部分进行相对于该字典的压缩。我们在大型文档集上证明,使用仅占文档集大小 0.1% 的字典,我们的算法比先前方法快得多,且通常能提供更好的压缩效果。
引用
@article{arxiv.1106.2587,
title = {Relative Lempel-Ziv Factorization for Efficient Storage and Retrieval of Web Collections},
author = {Christopher Hoobin and Simon J. Puglisi and Justin Zobel},
journal= {arXiv preprint arXiv:1106.2587},
year = {2015}
}
备注
VLDB2012