抓取搜索引擎结果页面作为存档种子:起始时间至关重要
摘要
基于事件的集合通常始于网络搜索,但您在第 1 天找到的搜索结果可能与第 7 天找到的不同。在本文中,我们考虑了源自从搜索引擎结果页面(SERP)提取 URI(统一资源标识符)的集合。具体而言,我们旨在提供关于在 Google 上找到的新闻故事 URI 可检索性的见解,并回答两个主要问题:首先,在一定时间后,能否从 Google 上“重新找到”同一新闻故事的 URI(针对同一查询)?其次,在给定时间段内,在 Google 上找到某个新闻故事的概率是多少?为了回答这些问题,我们在超过七个月的时间(2017-05-25 至 2018-01-12)内每天向 Google 发出七个查询,并从前五个 SERP 中收集链接,为每个查询生成七个集合。这些查询代表公众关注的故事:“healthcare bill”、“manchester bombing”、“london terrorism”、“trump russia”、“travel ban”、“hurricane harvey”和“hurricane irma”。我们随时间跟踪了所有集合中的每个 URI,以估计从前五个 SERP 中发现 URI 的能力。我们的结果显示,在默认的 Google SERP 上,新闻故事被替换的日均速率为 0.21 - 0.54,周速率为 0.39 - 0.79,表明较旧的故事被较新的故事快速替换。在 SERP 上首次出现后一天,找到同一新闻故事 URI 的概率在 0.34 - 0.44 之间。一周后,找到相同新闻故事的概率迅速降至 0.01 - 0.11。我们的研究结果表明,由于从 Google 检索新闻故事 URI 的困难性,源自搜索引擎的集合构建应尽快开始,以捕捉事件的最初阶段,并应持续进行,以捕捉事件的演变……
引用
@article{arxiv.1805.10260,
title = {Scraping SERPs for Archival Seeds: It Matters When You Start},
author = {Alexander C. Nwala and Michele C. Weigle and Michael L. Nelson},
journal= {arXiv preprint arXiv:1805.10260},
year = {2018}
}
备注
This is an extended version of the ACM/IEEE Joint Conference on Digital Libraries (JCDL 2018) full paper: https://doi.org/10.1145/3197026.3197056. Some of the figure numbers have changed