面向隐私政策的语义导向框架
人工智能
2025-09-03 v1 计算与语言
摘要
当代人拥有众多在线账户,但却很少阅读这些网站的服务条款或隐私政策,尽管声称自己阅读过,因为实际上难以理解它们。数据隐私实践的迷雾是以用户为中心的 Web 方法、数据共享与重用的障碍,尤其是在以主体为中心的世界中。现有研究提出了使用形式语言和推理来验证特定政策合规性的方法,作为忽略隐私政策的潜在解决方案。然而,仍存在大规模创建或获取此类形式政策的关键缺口。我们提出一种语义导向的方法,利用最先进的大语言模型(LLM),自动识别隐私政策中关于隐私实践的关键信息,并构建 ,从 Data Privacy Vocabulary (DPV) 中提取的知识图谱,用于支持下游任务。同时,还发布了针对前100个热门网站构建的 作为公共资源。我们演示了如何利用 构建形式化的政策表示,如 Open Digital Right Language (ODRL) 或持久语义数据使用条款(psDToU)。为评估技术能力,我们通过聘请法律专家创建自定义注释来丰富 Policy-IE 数据集。我们对不同大语言模型在管道中的性能进行基准测试并验证了其能力。总体而言,这些成果为大规模分析在线服务的隐私实践指明了可能性,作为审计 Web 和互联网的有前景的方向。我们将发布所有数据集和源代码作为公共资源,以促进复用和改进。
引用
@article{arxiv.2509.01716,
title = {An LLM-enabled semantic-centric framework to consume privacy policies},
author = {Rui Zhao and Vladyslav Melnychuk and Jun Zhao and Jesse Wright and Nigel Shadbolt},
journal= {arXiv preprint arXiv:2509.01716},
year = {2025}
}