LADFA:面向隐私政策中个人数据流分析的大语言模型与检索增强生成框架
人工智能
2026-01-16 v1 密码学与安全
摘要
隐私政策有助于 Inform people 关于组织处理个人数据的实践,涵盖数据收集、数据存储和与第三方共享个人数据等不同方面。由于使用的法律语言冗长且复杂,且不同行业和组织的做法不一致,人们往往难以完全理解隐私政策。为帮助进行自动化和大规模的隐私政策分析,许多研究者研究了机器学习和自然语言处理技术的应用,包括大语言模型(LLM)。虽然有限数量的先前研究利用 LLM 从隐私政策中提取个人数据流,但我们的做法在此基础上通过结合 LLM 与检索增强生成(RAG)以及来自现有研究的定制知识库,构建了一个端到端的计算框架 LADFA,该框架能够处理给定隐私政策中的非结构化文本,提取个人数据流并构建个人数据流图,对数据流图进行分析以促进洞察发现。该框架由预处理器、LLM 基于处理器和数据流后处理器组成。我们通过对十个选定的汽车行业隐私政策进行案例研究来演示和验证了所提出方法的有效性和准确性。值得注意的是,LADFA 旨在灵活和可定制,适用于广泛的基于文本的分析任务,超越隐私政策分析。
引用
@article{arxiv.2601.10413,
title = {LADFA: A Framework of Using Large Language Models and Retrieval-Augmented Generation for Personal Data Flow Analysis in Privacy Policies},
author = {Haiyue Yuan and Nikolay Matyunin and Ali Raza and Shujun Li},
journal= {arXiv preprint arXiv:2601.10413},
year = {2026}
}