大语言模型隐私政策演变的纵向测量研究
密码学与安全
2025-12-01 v1 人工智能
计算机与社会
摘要
大型语言模型(LLM)服务正快速融入人们的日常生活,作为聊天机器人和代理系统使用。它们通过收集丰富的数据流而得到营养,引发对过度收集敏感个人信息的隐私担忧。隐私政策是现代信息隐私范式中 informing 用户数据实践的基本机制。尽管传统的网页和移动端隐私政策已被广泛研究,但 LLM 提供商的隐私政策、其 LLM 特定内容以及随时间的演变仍 largely 未被探索。本文提出了对主流 LLM 提供商(覆盖 5 个国家,截至 2025 年 8 月)隐私政策的首个纵向实证研究。我们策划了包含 74 份历史隐私政策和 115 份补充隐私文件的 chronology 数据集,提取出超过 3000 处连续政策版本之间的句子级编辑。我们将 LLM 隐私政策与其他软件格式进行比较,提出专为 LLM 隐私政策设计的分类法,对政策编辑进行标注并与 LLM 生态关键事件的时间线对齐。结果表明,LLM 隐私政策显著更为冗长,需要 college-level 阅读水平,仍高度模糊。我们的分类分析揭示了提供商如何披露 LLM 特定实践的模式,并突显不同地区在覆盖范围上的差异。政策编辑集中在首方数据收集和国际/特定受众章节,产品发布和监管行动是主要驱动因素,这为揭示 LLM 隐私政策的现状与演变提供了视角。
引用
@article{arxiv.2511.21758,
title = {A Longitudinal Measurement of Privacy Policy Evolution for Large Language Models},
author = {Zhen Tao and Shidong Pan and Zhenchang Xing and Emily Black and Talia Gillis and Chunyang Chen},
journal= {arXiv preprint arXiv:2511.21758},
year = {2025}
}