规模化隐私保护:介绍 PrivaSeer 网络隐私政策语料库
信息检索
2024-04-02 v2 密码学与安全
摘要
各组织通过在其网站上发布隐私政策来披露其隐私实践。尽管用户常常在意其数字隐私,但他们往往不阅读隐私政策,因为这需要投入大量的时间与精力。尽管自然语言处理可助力隐私政策理解,但一直缺乏可用于分析、理解和简化隐私政策的大规模隐私政策语料库。为此,我们创建了 PrivaSeer,一个包含超过一百万份英文网站隐私政策的语料库,其规模显著大于此前任何可用语料库。我们设计了一个语料库构建流水线,包括网络爬取,随后利用语言检测、文档分类、重复与近似重复去除以及内容抽取进行文档过滤。我们考察了语料库的构成,并展示了可读性测试、文档相似度、关键短语抽取的结果,且通过主题建模对语料库进行了探索。
引用
@article{arxiv.2004.11131,
title = {Privacy at Scale: Introducing the PrivaSeer Corpus of Web Privacy Policies},
author = {Mukund Srinath and Shomir Wilson and C. Lee Giles},
journal= {arXiv preprint arXiv:2004.11131},
year = {2024}
}