中文

用于序列标注与法规合规识别的细粒度中文软件隐私政策数据集

密码学与安全 2022-12-09 v1 人工智能

摘要

隐私保护在法律层面和用户意识层面都引起了极大关注。为保护用户隐私,各国颁布法律法规,要求软件隐私政策规范其行为。然而,隐私政策以自然语言撰写,包含大量法律术语与软件行话,阻碍用户理解甚至阅读。亟需利用 NLP 技术来分析隐私政策,以帮助用户理解。此外,现有数据集忽略法律要求且局限于英文。本文构建了首个中文隐私政策数据集 CA4P-483,以推动隐私政策与软件之间的序列标注任务及法规合规识别。我们的数据集包含 483 份中文 Android 应用隐私政策、超过 11K 个句子和 52K 条细粒度标注。我们在该数据集上评估了若干鲁棒且具有代表性的基线模型家族。基于基线表现,我们给出了关于该数据集的发现与潜在研究方向。最后,我们结合法规要求和程序分析探讨了 CA4P-483 的潜在应用。

关键词

引用

@article{arxiv.2212.04357,
  title  = {A Fine-grained Chinese Software Privacy Policy Dataset for Sequence Labeling and Regulation Compliant Identification},
  author = {Kaifa Zhao and Le Yu and Shiyao Zhou and Jing Li and Xiapu Luo and Yat Fei Aemon Chiu and Yutong Liu},
  journal= {arXiv preprint arXiv:2212.04357},
  year   = {2022}
}

备注

Accepted by EMNLP 2022 (The 2022 Conference on Empirical Methods in Natural Language Processing)