中文

匿名化对话式AI日志中的推断性隐私泄露

计算机与社会 2026-05-25 v1 社会与信息网络

摘要

如今,数以亿计的用户与 ChatGPT 及类似 LLM 助手进行详细的、多轮的对话。我们在由四个全球南方国家(巴西、印度、尼日利亚、巴基斯坦)的 1000 多名用户捐赠的完整 ChatGPT 历史记录语料库上,测量了这些对话的两个隐私相关特征。首先,关于显式披露:34.5% 的用户消息包含跨越二十个类别分类的个人身份信息(PII),中位用户在其对话历史的前 14% 内首次透露了可识别内容。其次,关于超越显式披露的推断:我们将范围限制在一个群体中,其对话不包含被基于 LLM 的过滤器标记为显式人口统计自我识别的消息(一次单独的 NER 传递为披露审计标记了 PII,但不驱动群体排除)。在这个过滤后的群体上,现成的大语言模型仍然能以 0.84、0.90 和 0.88 的加权 F1 分数分别恢复每个用户的年龄、性别和国家,中位用户从其对话历史的前 5% 处即被识别。通过阅读模型的自然语言推理轨迹,我们识别出四种反复出现的刻板印象模式,这些模式既驱动了成功的推断,也导致了集中于技术领域女性、具有当代技能的老年用户以及全球南方技术专业人员的非对称误差分布。我们还将 ChatGPT 与这些相同用户的 Google 搜索和 YouTube 历史记录作为推断表面进行比较,发现它与这些推动了二十年行为广告的旧有数据基底相比具有竞争力。消息级别的 PII 移除作为对话式 AI 数据的隐私干预手段本身是不够的。

关键词

引用

@article{arxiv.2605.23820,
  title  = {Inferential Privacy Leakage in Anonymized Conversational AI Logs},
  author = {S M Mehedi Zaman and Kiran Garimella},
  journal= {arXiv preprint arXiv:2605.23820},
  year   = {2026}
}