大型语言模型:一种大规模隐私政策分析的新方法
计算与语言
2025-12-22 v1 计算机与社会
摘要
网络和移动应用程序的数量及其动态特性给评估其是否符合数据保护法带来了重大挑战。在此背景下,符号和统计自然语言处理(NLP)技术已被用于自动分析这些系统的隐私政策。然而,这些技术通常需要劳动密集型且可能容易出错的人工标注数据集进行训练和验证。本研究提出应用大型语言模型(LLM)作为一种替代方案,以有效且高效地从隐私政策中大规模提取隐私实践。特别是,我们利用了诸如ChatGPT和Llama 2等知名LLM,并就提示、参数和模型的最优设计提供了指导,结合了少样本学习等高级策略。我们进一步展示了其准确检测详细且多样化的隐私实践的能力。使用该领域几个著名数据集作为基准,我们的评估验证了其卓越性能,F1分数超过93%。此外,它还能以更低的成本、更快的处理时间和更少的技术知识要求实现这一点。因此,我们主张将基于LLM的解决方案作为传统NLP技术在大规模自动分析隐私政策方面的可靠替代方案。
引用
@article{arxiv.2405.20900,
title = {Large Language Models: A New Approach for Privacy Policy Analysis at Scale},
author = {David Rodriguez and Ian Yang and Jose M. Del Alamo and Norman Sadeh},
journal= {arXiv preprint arXiv:2405.20900},
year = {2025}
}