中文

用于隐私政策覆盖分析的序列分类模型的比较研究

计算与语言 2020-03-12 v1 机器学习 机器学习

摘要

隐私政策是描述网站如何收集、使用和分发用户数据的法律文件。遗憾的是,此类文件通常过于复杂且充满法律术语,使用户难以完全理解究竟收集了哪些数据以及为何收集。我们针对该问题的解决方案是,利用广泛的经典机器学习与深度学习技术,为给定网站的隐私政策提供覆盖分析。给定网站的隐私政策,分类器为每个逻辑片段识别相关的数据实践。这些数据实践/标签直接取自 OPP-115 语料库。例如,数据实践“数据保留”指的是网站存储用户信息的时间长短。该覆盖分析使用户能够确定十个可能的数据实践中被涵盖了多少个,并识别出与特定关注的数据实践相对应的章节。

关键词

引用

@article{arxiv.2003.04972,
  title  = {A Comparative Study of Sequence Classification Models for Privacy Policy Coverage Analysis},
  author = {Zachary Lindner},
  journal= {arXiv preprint arXiv:2003.04972},
  year   = {2020}
}