利用局部性进行 Web 搜索
信息检索
2012-12-12 v1 人工智能
摘要
关于 Web 爬取的已发表实验表明,给定形式为 Web(相对较小)子图的训练数据,其中包含选定类别的目标页面的子集,就可以进行定向搜索,并且比执行盲目或无信息的随机或系统性搜索(例如广度优先搜索)显著更快地找到额外的目标页面(所需的页面检索次数更少)。如果该主张属实,它将激发许多实际应用。不幸的是,这些实验是在难以复制的特定领域或条件下进行的。我们提出并应用了一个实验框架,旨在重新审视和解决早期工作的基本主张,以便支持性实验可以被复制和在此基础上构建。我们提供了用于构建实验性爬虫的高性能工具,利用了 WT10g TREC Web 语料库的真实基准和静态特性,并依靠简单且易于理解的机器学习技术来进行实验。在本文中,我们描述了基本框架,论证了实验设计的合理性,并报告了我们的发现,这些发现支持并限定了早期研究的结论。
引用
@article{arxiv.1212.2509,
title = {Exploiting Locality in Searching the Web},
author = {Joel Young and Thomas L. Dean},
journal= {arXiv preprint arXiv:1212.2509},
year = {2012}
}
备注
Appears in Proceedings of the Nineteenth Conference on Uncertainty in Artificial Intelligence (UAI2003)