高质量瞬时新内容的及时爬取
信息检索
2013-07-25 v2
摘要
如今,越来越多的人将网络作为获取最新信息的主要来源。在此背景下,对新创建网页的快速爬取和索引对搜索引擎至关重要,尤其是因为用户对这些新页面(如新闻、博客和论坛帖子)的访问量在其出现后迅速增长,但仅持续数天。本文研究了及时发现并爬取此类瞬时新页面(就用户兴趣而言)的问题。传统的爬取策略并未给予此类页面任何优先权,因此可能爬取速度不够快,甚至爬取已过时的内容。为此,我们提出了一种专为该任务设计的新指标,该指标考虑了用户对瞬时页面的兴趣随时间下降的因素。我们表明,大多数瞬时新页面可以在相对较少的内容源中找到,并提出了一种寻找此类集合的过程。我们的思路是定期重新爬取内容源,并爬取其中链接的新创建页面,重点关注高质量(就用户兴趣而言)的内容。此处的主要困难之一是如何在这两项活动之间有效分配资源。我们通过最大化所提出的指标来找到爬取与重新爬取之间的自适应平衡。此外,我们引入搜索引擎点击日志,使我们的爬取器能够洞察当前的用户需求。最后,通过在真实世界数据上的实验证明了该方法的有效性。
引用
@article{arxiv.1307.6080,
title = {Timely crawling of high-quality ephemeral new content},
author = {Damien Lefortier and Liudmila Ostroumova and Egor Samosvat and Pavel Serdyukov},
journal= {arXiv preprint arXiv:1307.6080},
year = {2013}
}