中文

关于网络追踪的普遍性:来自十亿级网页爬取的洞察

社会与信息网络 2016-08-01 v2

摘要

我们对 CommonCrawl 2012 语料库中超过 35 亿个网页上的第三方追踪器进行了大规模分析。我们提取了一个包含超过 4100 万个域名中 1.4 亿多个第三方嵌入的数据集。据我们所知,这是迄今为止收集的最大规模的网络追踪数据集,其在分析的域名和网页数量上超过了相关研究一个数量级以上。我们在三个层面上进行了大规模的在线追踪研究:(1) 在全球层面上,我们给出了追踪范围的精确数据,洞察“在线追踪领域”的结构,并分析了有多少网站使用了哪些追踪器。(2) 在国家特定层面上,我们分析了不同国家的网站使用了哪些追踪器,并确定了那些网站选择的追踪器与世界其他地区显著不同的国家。(3) 我们回答了网站内容是否影响其选择的追踪器这一问题,利用了超过 9 万个分类域名。特别是,我们分析了具有高度隐私关键内容的网站是否比其他网站做出了不同的追踪器选择。基于所进行的分析,我们确认追踪器广泛存在(正如预期),且少数追踪器主导了网络(Google、Facebook 和 Twitter)。特别是,PageRank 最高的三个追踪域名均归 Google 所有。这一模式的唯一例外是中国和俄罗斯等少数国家。我们的结果表明,这种主导地位与特定国家的政治因素(如新闻自由)密切相关。我们还确认,具有高度隐私关键内容的网站包含追踪器的可能性较低(60% 对比其他网站的 90%),尽管其中大多数仍然包含追踪器。

关键词

引用

@article{arxiv.1607.07403,
  title  = {On the Ubiquity of Web Tracking: Insights from a Billion-Page Web Crawl},
  author = {Sebastian Schelter and Jérôme Kunegis},
  journal= {arXiv preprint arXiv:1607.07403},
  year   = {2016}
}