中文

PolicyLR:一种隐私政策的逻辑表示

密码学与安全 2024-08-28 v1 计算与语言

摘要

隐私政策在在线生态系统中至关重要,它定义了服务如何处理用户数据并遵守 GDPR 和 CCPA 等法规。然而,其复杂性和频繁更新往往使利益相关者难以理解和分析。当前利用自然语言处理的自动化分析方法存在局限性,它们通常专注于单个任务,无法捕捉政策的完整上下文。我们提出了 PolicyLR,这是一种提供隐私政策全面机器可读表示的新范式,可作为多种下游任务的一体化解决方案。PolicyLR 利用原子公式的赋值将隐私政策转换为机器可读格式,从而允许对合规性和一致性等任务进行形式化定义。我们开发了一个编译器,利用现成的大型语言模型(LLM)将非结构化政策文本转换为这种格式。该编译器将转换任务分解为两阶段的翻译和蕴含过程。此过程考虑隐私政策的完整上下文以推断出一个复杂公式,其中每个公式由更简单的原子公式组成。该模型的优势在于 PolicyLR 在设计上具有可解释性,并植根于隐私政策的片段。我们使用社区注释的隐私政策蕴含数据集 ToS;DR 对编译器进行了评估。利用开源 LLM,我们的编译器达到了 0.91 的精确率和 0.88 的召回率。最后,我们展示了 PolicyLR 在三个隐私任务中的实用性:政策合规性、不一致性检测和隐私比较购物。

关键词

引用

@article{arxiv.2408.14830,
  title  = {PolicyLR: A Logic Representation For Privacy Policies},
  author = {Ashish Hooda and Rishabh Khandelwal and Prasad Chalasani and Kassem Fawaz and Somesh Jha},
  journal= {arXiv preprint arXiv:2408.14830},
  year   = {2024}
}