中文

面向网络文档集高效存储与检索的相对 Lempel-Ziv 分解

数据结构与算法 2015-03-19 v2 数据库 信息检索

摘要

支持快速随机访问的压缩技术是任何信息系统的核心组成部分。当前最先进的方法将文档分组为固定大小的块,并使用如 GZIP 等通用自适应算法压缩每个块。对特定文档的随机访问则需要解压整个块。块大小的选择至关重要:它在压缩效率与文档检索时间之间进行权衡。本文提出一种面向大型文档集的可扩展压缩方法,支持快速随机访问。我们构建文档集的一个代表性样本,并将其作为字典,以类似 LZ77 的编码方式对文档集其余部分进行相对于该字典的压缩。我们在大型文档集上证明,使用仅占文档集大小 0.1% 的字典,我们的算法比先前方法快得多,且通常能提供更好的压缩效果。

关键词

引用

@article{arxiv.1106.2587,
  title  = {Relative Lempel-Ziv Factorization for Efficient Storage and Retrieval of Web Collections},
  author = {Christopher Hoobin and Simon J. Puglisi and Justin Zobel},
  journal= {arXiv preprint arXiv:1106.2587},
  year   = {2015}
}

备注

VLDB2012