中文

面向GDPR的隐私政策分析综合研究:分类体系、语料库与GDPR概念分类器

密码学与安全 2026-01-21 v2

摘要

以隐私政策为输入并预测相关概念的机器学习分类器,在针对欧盟GDPR的(半)自动化合规分析等应用中具有重要价值。在以往的所有研究中,此类分类器为每个片段(如句子)生成一个概念标签,其性能评估使用的是带标签的片段数据集,而未考虑这些片段所属的隐私政策。然而,这种方法可能会高估在现实世界中的性能,因为在现实世界中,新隐私政策中的所有片段都是未见过的。此外,我们还观察到其他研究空白,包括缺乏更完整的GDPR分类体系,以及对隐私政策中层级信息的考虑不足。为填补这些研究空白,我们开发了一个更完整的GDPR分类体系,构建了第一个带层级信息的带标签隐私政策语料库,并对GDPR概念分类器进行了最全面的性能评估。我们的工作产生了多项新发现,包括证实了在片段级别划分训练集和测试集的不恰当性、考虑层级信息的好处、“一刀切”方法的局限性,以及跨语料库测试的重要性。

关键词

引用

@article{arxiv.2410.04754,
  title  = {A Comprehensive Study on GDPR-Oriented Analysis of Privacy Policies: Taxonomy, Corpus and GDPR Concept Classifiers},
  author = {Peng Tang and Xin Li and Yuxin Chen and Weidong Qiu and Haochen Mei and Allison Holmes and Fenghua Li and Shujun Li},
  journal= {arXiv preprint arXiv:2410.04754},
  year   = {2026}
}