论随机索引分区对索引压缩的影响
信息检索
2011-07-29 v1
摘要
处理搜索查询的性能在很大程度上取决于存储的索引大小。因此,大量研究工作致力于开发高效的倒排索引压缩技术。粗略地说,索引压缩依赖于两个因素:被索引文档的排序,旨在将相似文档置于邻近位置;以及对由有序文档流产生的倒排列表进行编码。大型商业搜索引擎索引着不断增长的 Web 上数百亿的网页。其索引的庞大规模决定了在一种称为本地索引分区的方案中将文档分布到数千台服务器上,使得每台服务器仅索引数百万个网页。出于工程和运行时性能的考虑,将文档随机分布到服务器是常见的做法。然而,在众多服务器间进行随机索引分区会对最终的索引大小产生不利影响,因为它降低了文档排序方案的有效性。我们研究了随机索引分区对文档排序方案的影响。我们表明,当每台服务器内的文档被随机重排时,索引分区会使倒排列表的总大小随服务器数量的增加呈对数减小。另一方面,当应用诸如字典序 URL 排序和 TSP 聚类等最先进的文档排序方案时,分区后的总索引大小随服务器数量的增加呈对数增大。最后,我们证明了随机分配文档到服务器的常见做法是合理的,因为我们定性地表明,尽管它对随后的压缩产生了不利影响,但与压缩效果更好的分区技术相比,它将分布式查询评估时间中的关键因素降低了一个数量级。
引用
@article{arxiv.1107.5661,
title = {On the Impact of Random Index-Partitioning on Index Compression},
author = {M. Feldman and R. Lempel and O. Somekh and K. Vornovitsky},
journal= {arXiv preprint arXiv:1107.5661},
year = {2011}
}
备注
9 pages, 4 figures