中文

面向数据隐私文档的自动比对:基于类GDPR法律的初步实验

计算与语言 2021-05-24 v1 信息检索

摘要

通用数据保护条例(GDPR)已成为许多国家数据保护的标准法律。目前有十二个国家采纳该条例并建立了各自的类GDPR法规。然而,评估这些类GDPR法规的异同十分耗时,且需要法律专家的大量人工投入。此外,不同国家的类GDPR法规以其本国语言撰写,由于必须依赖通晓两种语言的法律专家,任务变得更加困难。本文研究了一种简单的自然语言处理(NLP)方法来解决该问题。我们首先从类GDPR文档中抽取信息块,并将自然语言转化为结构化数据。接着,我们使用NLP方法比对文档以衡量其相似度。最后,我们人工标注了一小部分数据来评估我们的方法。实证结果表明,采用余弦相似度的BERT模型优于其他基线。我们的数据与代码已公开可用。

关键词

引用

@article{arxiv.2105.10117,
  title  = {Towards Automatic Comparison of Data Privacy Documents: A Preliminary Experiment on GDPR-like Laws},
  author = {Kornraphop Kawintiranon and Yaguang Liu},
  journal= {arXiv preprint arXiv:2105.10117},
  year   = {2021}
}

备注

This is a preliminary work, see repo at https://github.com/kornosk/GDPR-similarity-comparison