中文

通过伪标签成员身份微调放大训练数据暴露

计算与语言 2024-09-04 v2 密码学与安全 机器学习

摘要

由于数据记忆化,神经语言模型(LMs)容易受到训练数据提取攻击。本文介绍了一种新颖的攻击场景,其中攻击者对抗性地微调预训练语言模型,以放大原始训练数据的暴露。该策略与以往研究不同,旨在强化语言模型对其预训练数据集的保留。为实现这一目标,攻击者需要收集与预训练数据紧密对齐的生成文本。然而,在不知晓实际数据集的情况下,量化生成文本中预训练数据的含量具有挑战性。为解决这一问题,我们提出对这些生成文本使用伪标签,利用目标语言模型生成的机器概率所指示的成员身份近似值。随后,我们根据成员身份概率微调语言模型,使其倾向于生成更可能源自预训练数据的文本。我们的实证结果表明了一个显著的结果:参数超过 10 亿的语言模型,其训练数据暴露量增加了四到八倍。我们讨论了潜在的缓解措施并提出了未来的研究方向。

关键词

引用

@article{arxiv.2402.12189,
  title  = {Amplifying Training Data Exposure through Fine-Tuning with Pseudo-Labeled Memberships},
  author = {Myung Gyo Oh and Hong Eun Ahn and Leo Hyun Park and Taekyoung Kwon},
  journal= {arXiv preprint arXiv:2402.12189},
  year   = {2024}
}

备注

20 pages, 6 figures, 15 tables