BUbiNG:面向大众的大规模爬虫
信息检索
2016-01-27 v1 社会与信息网络
摘要
尽管网络爬虫问世至今已有二十年,但几乎不存在免费可用、开源的爬虫软件,能够保障高吞吐量的同时克服单机系统的限制并随可用资源量线性扩展。本文旨在通过描述BUbiNG来填补这一空白,BUbiNG是我们基于作者使用UbiCrawler [Boldi et al. 2004]的经验以及过去十年该主题的研究而构建的下一代网络爬虫。BUbiNG是一个开源Java全分布式爬虫;单个BUbiNG代理在配备可观硬件时,能够每秒抓取数千页面,并遵守严格的礼貌约束(包括基于主机和基于IP的)。与依赖批处理技术(如MapReduce)的现有开源分布式爬虫不同,BUbiNG的任务分发基于现代高速协议,从而实现了极高的吞吐量。
引用
@article{arxiv.1601.06919,
title = {BUbiNG: Massive Crawling for the Masses},
author = {Paolo Boldi and Andrea Marino and Massimo Santini and Sebastiano Vigna},
journal= {arXiv preprint arXiv:1601.06919},
year = {2016}
}