中文

隐私政策的历时演变:百万文档数据集的构建与分析

计算机与社会 2021-07-22 v4

摘要

隐私政策的自动化分析已被证明是一个富有成果的研究方向,诸如自动化政策摘要、问答系统和合规性检测等进展层出不穷。先前的研究受限于对单一时间点或短时间跨度内隐私政策的分析,因为研究者无法获得大规模、纵向、经过整理的数据集。为弥补这一缺口,我们开发了一个爬虫,从互联网档案馆的Wayback Machine中发现、下载并提取归档的隐私政策。利用该爬虫并经过一系列验证与质量控制步骤,我们整理了一个包含1,071,488份英文隐私政策的数据集,时间跨度超过二十年,涵盖超过130,000个不同网站。我们对数据的分析描绘了一幅关于隐私政策透明度和可访问性的令人担忧的图景。通过将我们数据集中追踪相关术语的出现情况与先前的网络隐私测量相比较,我们发现隐私政策一贯未能披露常见追踪技术和第三方的存在。我们还发现,在过去二十年中隐私政策变得更难阅读,长度翻倍,中位阅读水平提升整整一个年级。我们的数据表明,第一方网站的自我监管已停滞,而第三方的自我监管有所增加,但由在线广告行业协会主导。最后,我们通过展示GDPR对隐私政策的历史影响,为隐私监管相关文献作出贡献。

关键词

引用

@article{arxiv.2008.09159,
  title  = {Privacy Policies over Time: Curation and Analysis of a Million-Document Dataset},
  author = {Ryan Amos and Gunes Acar and Eli Lucherini and Mihir Kshirsagar and Arvind Narayanan and Jonathan Mayer},
  journal= {arXiv preprint arXiv:2008.09159},
  year   = {2021}
}

备注

16 pages, 13 figures, public dataset