中文

网络爬虫简史

信息检索 2014-05-06 v1

摘要

网络爬虫访问互联网应用,收集数据,并从已访问页面中了解新网页。网络爬虫有着悠久而有趣的历史。早期的网络爬虫主要收集关于网络的统计数据。除了收集网络统计数据和为搜索引擎索引应用外,现代爬虫还可用于执行应用的无障碍性和漏洞检查。网络的快速扩张以及网络应用复杂性的增加,使得爬取过程极具挑战性。在网络爬虫的发展史上,许多研究人员和工业团体解决了网络爬虫面临的不同问题和挑战。人们提出了不同的解决方案以减少爬取的时间和成本。执行 exhaustive crawl(穷尽爬取)是一个具有挑战性的问题。此外,捕捉现代网络应用的模型并从中自动提取数据是另一个开放性问题。下文简要介绍了从早期到近期所使用的不同技术和算法的历史。我们引入了评估网络爬虫相对性能的标准。基于这些标准,我们绘制了网络爬虫的演进过程并比较了它们的性能。

关键词

引用

@article{arxiv.1405.0749,
  title  = {A Brief History of Web Crawlers},
  author = {Seyed M. Mirtaheri and Mustafa Emre Dinçktürk and Salman Hooshmand and Gregor V. Bochmann and Guy-Vincent Jourdan and Iosif Viorel Onut},
  journal= {arXiv preprint arXiv:1405.0749},
  year   = {2014}
}