中文

大语言模型(LLM)与您的姓名相关联?基于人类中心的黑箱隐私审计

人机交互 2026-02-20 v1 人工智能 计算与语言 计算机与社会

摘要

大型语言模型(LLM)以及基于它们的对话式智能体在预训练期间和用户交互期间都会接触到个人数据(PD)。已有研究表明 PD 可能会复现,但用户缺乏洞察模型将特定信息与其身份关联的强度。我们对八个 LLM(3 个开源模型;5 个基于 API 的模型,包括 GPT-4o)进行了 PD 审计,引入了 LMP2(Language Model Privacy Probe),这是一种经过两项形成性研究(N=20)精炼的以人类为中心、隐私保护的审计工具,并开展了两项欧盟居民的研究以捕捉(i)关于 LLM 生成 PD 的直觉(N1=155)和(ii)对工具输出的反应(N2=303)。我们证实,模型能够自信地为知名人士生成多个 PD 类别。对于普通用户,GPT-4o 以 60% 或更高准确率生成 11 项特征(例如性别、发色、语言)。最终,72% 的参与者寻求对模型生成的与其姓名相关联的信息进行控制,这引发了关于 PD 何为以及数据隐私权是否应延伸至 LLM 的问题。

关键词

引用

@article{arxiv.2602.17483,
  title  = {What Do LLMs Associate with Your Name? A Human-Centered Black-Box Audit of Personal Data},
  author = {Dimitri Staufer and Kirsten Morehouse},
  journal= {arXiv preprint arXiv:2602.17483},
  year   = {2026}
}