中文

从大语言模型中提取训练数据

密码学与安全 2021-06-16 v2 计算与语言 机器学习

摘要

发布在私有数据集上训练的大型(十亿参数)语言模型已变得普遍。本文证明在此类设置下,攻击者可通过查询语言模型执行训练数据提取攻击,以恢复个别训练样本。我们在 GPT-2(一个在公开互联网抓取数据上训练的语言模型)上演示了我们的攻击,并能够从模型的训练数据中提取数百条逐字文本序列。这些提取出的样本包括(公开的)个人可识别信息(姓名、电话号码和电子邮件地址)、IRC 对话、代码以及 128 位 UUID。尽管上述每个序列在训练数据中仅出现于一个文档中,我们的攻击仍然可行。我们全面评估了提取攻击以理解导致其成功的因素。令人担忧的是,我们发现较大的模型比较小的模型更易受攻击。最后我们总结经验教训并讨论训练大语言模型可能的防护措施。

关键词

引用

@article{arxiv.2012.07805,
  title  = {Extracting Training Data from Large Language Models},
  author = {Nicholas Carlini and Florian Tramer and Eric Wallace and Matthew Jagielski and Ariel Herbert-Voss and Katherine Lee and Adam Roberts and Tom Brown and Dawn Song and Ulfar Erlingsson and Alina Oprea and Colin Raffel},
  journal= {arXiv preprint arXiv:2012.07805},
  year   = {2021}
}