使用大型语言模型对GDPR透明度合规在隐私政策中的词级注释
计算与语言
2025-11-25 v2 人工智能
摘要
确保与个人信息处理相关数据实践的透明度是通用数据保护条例(GDPR)的核心要求。然而,由于隐私政策语言的复杂性和多样性,大规模合规性评估仍具有挑战性。手动审计耗时且不一致,而当前的自动方法往往缺乏捕捉细微透明度披露所需的细粒度。本文提出了一种基于大型语言模型(LLM)的模块化管道,用于针对GDPR透明度要求对隐私政策进行词级注释。我们的方案将LLM驱动的注释与段落级分类、检索增强生成和自校正机制集成,以实现对21项GDPR衍生透明度要求的可扩展、情境感知注释。为支持实证评估,我们构建了703,791篇英文隐私政策的语料库,并生成了200篇基于全面、GDPR对齐注释方案的手动注释政策样本。我们提出了两种层次的评估方法,覆盖段落级分类和跨度级注释质量,并对包括广为人知的OPP-115数据集在内的七种最先进LLM进行比较分析。我们的评估结果表明,分解注释任务并整合针对性检索和分类组件显著提高了注释准确性,尤其是针对结构良好的要求。我们的工作为在规模上推动自动化透明度合规评估提供了新的实证资源和方法学基础。
引用
@article{arxiv.2503.10727,
title = {Word-level Annotation of GDPR Transparency Compliance in Privacy Policies using Large Language Models},
author = {Thomas Cory and Wolf Rieder and Julia Krämer and Philip Raschke and Patrick Herbke and Axel Küpper},
journal= {arXiv preprint arXiv:2503.10727},
year = {2025}
}
备注
Accepted to Proceedings on Privacy Enhancing Technologies (PoPETs) 1 (2026)