中文

PolicyGPT:基于大语言模型的隐私政策自动分析

计算与语言 2023-09-20 v1

摘要

隐私政策是在线服务提供商告知用户其数据收集与使用流程的主要渠道。然而,为了力求全面并降低法律风险,这些政策文档往往十分冗长。在实际使用中,用户倾向于直接点击“同意”按钮而非仔细阅读。这种做法使用户面临隐私泄露与法律问题的风险。近来,ChatGPT 与 GPT-4 等大语言模型(LLM)的出现为文本分析,尤其是隐私政策这类长篇文档的分析开辟了新可能。在本研究中,我们探究了一种基于 LLM 的隐私政策文本分析框架 PolicyGPT。该框架使用两个数据集进行了测试。第一个数据集包含来自 115 个网站的隐私政策,由法律专家细致标注,将每个片段归类为 10 个类别之一。第二个数据集由 304 款热门移动应用的隐私政策组成,每句话经人工标注并归入另外 10 个类别之一。在零样本学习条件下,PolicyGPT 展现出稳健性能。对于第一个数据集,其准确率达 97%;对于第二个数据集,准确率为 87%,超越了基线机器学习与神经网络模型。

关键词

引用

@article{arxiv.2309.10238,
  title  = {PolicyGPT: Automated Analysis of Privacy Policies with Large Language Models},
  author = {Chenhao Tang and Zhengliang Liu and Chong Ma and Zihao Wu and Yiwei Li and Wei Liu and Dajiang Zhu and Quanzheng Li and Xiang Li and Tianming Liu and Lei Fan},
  journal= {arXiv preprint arXiv:2309.10238},
  year   = {2023}
}