中文

面向事件集合构建的Web归档聚焦爬取

数字图书馆 2018-04-06 v1

摘要

事件集合通常通过在实时网络上基于人类专家提名的种子URI进行爬取来构建。聚焦网络爬取是一种由与事件相关的参考内容引导爬虫的技术。鉴于网络的动态特性以及话题演变的速度,爬取时机对两种方法而言都是个问题。我们研究了在归档网络上执行聚焦爬取的可行性。通过利用Memento基础设施,我们从22个Web归档中获取资源以助于构建事件集合。我们针对四个事件创建集合,并将其资源的相关性以及与通过爬取实时网络构建的集合和人工策划集合进行比较。我们的结果表明,在归档网络上的聚焦爬取是可行的,并且确实能产生高度相关的集合,特别是对于发生在更久以前的事件。

关键词

引用

@article{arxiv.1804.01603,
  title  = {Focused Crawl of Web Archives to Build Event Collections},
  author = {Martin Klein and Lyudmila Balakireva and Herbert Van de Sompel},
  journal= {arXiv preprint arXiv:1804.01603},
  year   = {2018}
}

备注

accepted for publication at WebSci 2018