中文

面向大语言模型的用户推断攻击

密码学与安全 2024-02-27 v2 计算与语言 机器学习

摘要

微调是一种常见且有效的方法,用于使大语言模型(LLMs)适应专门任务与应用。在本文中,我们研究在用户数据上微调LLMs的隐私影响。为此,我们考虑一种称为用户推断的现实威胁模型,其中攻击者推断某用户的数据是否被用于微调。我们设计的用户推断攻击仅需对微调后LLM的黑盒访问,以及来自该用户的少量样本(不必来自微调数据集)。我们发现LLMs在多种微调数据集上易受用户推断攻击,有时攻击成功率近乎完美。进一步,我们从理论与实证上探究使用户易受用户推断攻击的性质,发现离群用户、样本间具有可识别共享特征的用户,以及对微调数据贡献占比较大比例的用户最易受攻击。基于这些发现,我们确定若干缓解用户推断的方法,包括以样例级差分隐私训练、移除用户内重复样例,以及降低用户对训练数据的贡献。尽管这些技术提供了部分缓解,我们强调亟需开发方法以完全保护微调LLMs抵御此隐私风险。

关键词

引用

@article{arxiv.2310.09266,
  title  = {User Inference Attacks on Large Language Models},
  author = {Nikhil Kandpal and Krishna Pillutla and Alina Oprea and Peter Kairouz and Christopher A. Choquette-Choo and Zheng Xu},
  journal= {arXiv preprint arXiv:2310.09266},
  year   = {2024}
}

备注

v2 contains experiments on additional datasets and differential privacy