中文

针对 SATML 语言模型数据提取挑战的 GPT-Neo 定向攻击

计算与语言 2023-02-16 v1 人工智能 密码学与安全

摘要

已有研究表明,大语言模型易受所谓的数据提取攻击。这使得攻击者能够提取训练数据中包含的样本,具有巨大的隐私影响。数据提取攻击的构建具有挑战性,当前攻击效率颇低,且非定向攻击的提取能力与记忆化之间存在显著差距。因此,研究者提出定向攻击,用以判断训练数据中的给定样本是否可从模型中被提取。本工作中,我们将定向数据提取攻击应用于 SATML2023 语言模型训练数据提取挑战。我们采用两步法。第一步,我们最大化模型的召回率,能够提取 69% 样本的后缀。第二步,我们对生成内容使用基于分类器的成员推断攻击(Membership Inference Attack)。我们的 AutoSklearn 分类器达到了 0.841 的精确率。完整方法在 10% 假阳性率下达到 0.405 的召回率得分,较 0.301 的基线提升了 34%。

关键词

引用

@article{arxiv.2302.07735,
  title  = {Targeted Attack on GPT-Neo for the SATML Language Model Data Extraction Challenge},
  author = {Ali Al-Kaswan and Maliheh Izadi and Arie van Deursen},
  journal= {arXiv preprint arXiv:2302.07735},
  year   = {2023}
}