人类中心的 LLM 隐私审计:发现与摩擦
人机交互
2026-03-13 v1 人工智能
计算与语言
计算机与社会
摘要
大型语言模型 (LLM) 从海量训练语料库和用户交互中学习统计关联,部署的系统可表现或推断有关个体的信息。然而,人们缺乏实用的检验方法来检查模型是否将某人的姓名与之关联。我们报告进行中的研究的中间发现,并引入 LMP2,这是一个基于浏览器的自我审计工具。在两项用户研究中 () 中,GPT-4o 对普通人预测 50 个特征中的 11 个,准确率达到 60%,且参与者报告希望对 LLM 生成的关联拥有控制权,尽管他们不认为所有输出都构成隐私违规。为了验证我们的探针方法,我们在公众人物和不存在的姓名上评估了八个 LLM,观察到稳定的以姓名为条件的关联与模型默认值之间存在明显分离。我们的发现还为暴露更广泛的生成式 AI 评估危机贡献了:当输出是概率性的、情境依赖的,并且通过触发性用户介入时,什么样的模型-个体关联甚至包括在内是未指定的,操作化依赖于构建难以验证或比较的探针和指标。为了走向可靠、可操作的人类中心的 LLM 隐私审计,我们识别了在我们的研究中出现的九个摩擦,并为未来的工作和人类中心 LLM 隐私审计设计提供了建议。
引用
@article{arxiv.2603.12094,
title = {Human-Centred LLM Privacy Audits: Findings and Frictions},
author = {Dimitri Staufer and Kirsten Morehouse and David Hartmann and Bettina Berendt},
journal= {arXiv preprint arXiv:2603.12094},
year = {2026}
}