中文

探索大语言模型上强成员推断攻击的极限

密码学与安全 2026-01-09 v3 人工智能 机器学习

摘要

最新技术的成员推断攻击 (Membership Inference Attacks, MIAs) 通常需要训练大量参考模型,这使得将这些攻击扩展到大型预训练语言模型 (Large Language Models, LLMs) 具有挑战性。因此,先前的研究要么依赖于规模较小的模型和数据集上应用的强攻击,要么依赖于规模较小的模型和数据集上应用的弱攻击。然而,弱攻击已被证明脆弱,而来自简化环境中强攻击的见解并不必然转化为今天的 LLMs。这促使了一个重要问题:我们观察到的限制是由于攻击设计选择,还是 MIAs 在 LLMs 上本质上是无效的?我们通过将 LiRA——一种强大的 MIA——扩展到 10M 到 1B 参数的 GPT-2 架构,训练参考模型使用来自 C4 数据集的超过 200 亿个标记,来回应这一问题。我们的结果以四个关键方式推进了对 LLMs 上 MIA 的理解:尽管 (1) 强 MIA 可在预训练 LLMs 上成功, (2) 其有效性仍有限(例如 AUC<0.7)于实际环境中。 (3) 即使在强 MIA 实现优于随机 AUC 时,聚合指标也可能掩盖大量 MIA 决策的显著逐样本不稳定性:由于训练随机性,许多决策如此不稳定,以至于在统计上与硬币投掷无异。最后, (4) MIA 成功与相关 LLM 隐私指标之间的关系并不像以前的工作所暗示的那样直接明了。

关键词

引用

@article{arxiv.2505.18773,
  title  = {Exploring the limits of strong membership inference attacks on large language models},
  author = {Jamie Hayes and Ilia Shumailov and Christopher A. Choquette-Choo and Matthew Jagielski and George Kaissis and Milad Nasr and Sahra Ghalebikesabi and Meenatchi Sundaram Mutu Selva Annamalai and Niloofar Mireshghallah and Igor Shilov and Matthieu Meeus and Yves-Alexandre de Montjoye and Katherine Lee and Franziska Boenisch and Adam Dziedzic and A. Feder Cooper},
  journal= {arXiv preprint arXiv:2505.18773},
  year   = {2026}
}

备注

NeurIPS 2025