中文

基于网络爬虫的互联网审查自动发现

计算机与社会 2018-04-20 v2

摘要

互联网审查在世界范围内十分普遍。随着网络接入日益无处不在,对这一资源的过滤也变得愈发泛滥。关于公民被拒绝访问的具体内容的透明度并不常见。为此,许多个人和组织提出了多种维护 URL 过滤列表的技术,旨在为公众和更广泛的审查研究界提供审查的实证数据。我们提出了一种在不同国家发现被过滤域名的新方法。该方法完全自动化,无需人工干预。系统使用网络爬虫技术在被过滤站点间遍历,并实现了一种稳健的方法来判断某个域名是否被过滤。我们通过在四种不同审查体制下运行实验搜索被过滤内容,证明了该方法的有效性。我们的结果表明,我们的表现优于当前最先进水平(SOTA),并且构建的域名过滤列表规模比截至 2018 年 1 月最广泛可用的公共列表大一个数量级。此外,我们构建了一个映射域名间被屏蔽内容互联特性的数据集,并展示了被审查网络资源紧密成网的性质。

关键词

引用

@article{arxiv.1804.03056,
  title  = {Automated Discovery of Internet Censorship by Web Crawling},
  author = {Alexander Darer and Oliver Farnan and Joss Wright},
  journal= {arXiv preprint arXiv:1804.03056},
  year   = {2018}
}