中文

超越记忆:利用大语言模型通过推理侵犯隐私

人工智能 2024-05-07 v2 机器学习

摘要

当前关于大语言模型(LLMs)的隐私研究主要关注提取记忆化训练数据的问题。与此同时,模型的推理能力大幅提升。这引出了一个关键问题:当前的 LLM 是否能在推理时通过从给定文本推断个人属性来侵犯个体隐私。本文首次对预训练 LLM 从文本推断个人属性的能力进行了全面研究。我们构建了一个由真实 Reddit 用户档案组成的数据集,并表明当前 LLM 可推断广泛的个人属性(如地点、收入、性别),以人类所需成本(100×100\times)和时间(240×240\times)的极小部分达到最高 85%85\% 的 top-1 与 95%95\% 的 top-3 准确率。随着人们日益在所有生活方面与 LLM 驱动的聊天机器人交互,我们也探讨了隐私侵入型聊天机器人试图通过看似无害的问题提取个人信息的新兴威胁。最后,我们表明常见的缓解措施,即文本匿名化与模型对齐,目前无法有效保护用户隐私免受 LLM 推理的侵害。我们的发现强调,当前 LLM 能以先前无法企及的规模推断个人数据。在缺乏有效防御的情况下,我们倡导围绕超越记忆化的 LLM 隐私影响展开更广泛的讨论,以谋求更全面的隐私保护。

关键词

引用

@article{arxiv.2310.07298,
  title  = {Beyond Memorization: Violating Privacy Via Inference with Large Language Models},
  author = {Robin Staab and Mark Vero and Mislav Balunović and Martin Vechev},
  journal= {arXiv preprint arXiv:2310.07298},
  year   = {2024}
}