中文

SoK: 大语言模型的成员推理攻击正在急流而来(以及如何修复)

计算与语言 2025-03-10 v3 密码学与安全 机器学习

摘要

是否 LLMs 记住其训练数据以及这意味着什么,从测量隐私泄漏到检测版权侵权,已成为快速增长的研究领域。过去几个月里,提出了超过 10 种新方法,对 LLMs 进行成员推理攻击(MIAs)。与依赖固定但随机记录或模型的传统 MIAs 不同,这些方法大多在事后收集的数据集上进行训练和测试。用于评估 MIA 的成员和非成员集合,是在模型发布后通过 Informed 猜测构建的。这一缺乏随机化的做法引发了成员和非成员之间分布迁移的担忧。本文首先广泛审阅了关于 LLMs 成员推理攻击的文献,表明尽管大多数工作聚焦于在事后环境下评估的序列级 MIAs,但涉及的目标模型、动机和感兴趣单元范围较广。我们随后使用一种无模型的词袋分类器量化了文献中 6 个数据集上存在的分布迁移,表明所有事后构建的数据集都存在显著的分布迁移。这些迁移无效地推翻了 LLMs 在现实场景中强烈记忆的论点,可能也无效地支撑了基于这些数据集的最近论文的方法学贡献。然而,希望并不完全消失。我们提出了正确评估 LLMs 成员推理攻击的重要考虑因素,并讨论了潜在的前进路径:随机化测试划分、注入随机(唯一)序列、随机化微调以及几种事后控制方法。尽管每种选择都各有优缺点,但我们认为它们共同为指导 MIA 开发和研究 LLM 记忆提供了坚实的依据。我们以概述推荐方法来评估针对 LLMs 的序列级和文档级 MIAs 作为结论。

关键词

引用

@article{arxiv.2406.17975,
  title  = {SoK: Membership Inference Attacks on LLMs are Rushing Nowhere (and How to Fix It)},
  author = {Matthieu Meeus and Igor Shilov and Shubham Jain and Manuel Faysse and Marek Rei and Yves-Alexandre de Montjoye},
  journal= {arXiv preprint arXiv:2406.17975},
  year   = {2025}
}

备注

IEEE Conference on Secure and Trustworthy Machine Learning (SaTML 2025)