中文

成员推断攻击对大型语言模型有效吗?

计算与语言 2024-09-17 v2

摘要

成员推断攻击(Membership Inference Attacks, MIAs)试图预测特定数据点是否属于目标模型的训练数据。尽管针对传统机器学习模型的 MIA 研究已十分广泛,但针对大型语言模型(LLMs)预训练数据的 MIA 研究却十分有限。我们对一系列在 Pile 数据集上训练的语言模型(LMs)进行了大规模 MIA 评估,参数量范围从 1.6 亿到 120 亿。我们发现,在大多数设置下,无论 LLM 规模大小或领域如何,MIA 的表现仅略优于随机猜测。进一步的分析表明,这种糟糕的表现可归因于:(1) 大数据集与少量训练迭代的组合;(2) 成员与非成员之间 inherently fuzzy 的边界。我们识别了 LLM 已被证明易受成员推断攻击的特定设置,并表明此类设置中看似成功的攻击可归因于分布偏移,例如当成员与非成员取自看似相同但时间范围不同的领域时。我们发布了代码和数据,作为一个统一的基准包,其中包含所有现有的 MIA 方法,以支持未来的工作。

关键词

引用

@article{arxiv.2402.07841,
  title  = {Do Membership Inference Attacks Work on Large Language Models?},
  author = {Michael Duan and Anshuman Suri and Niloofar Mireshghallah and Sewon Min and Weijia Shi and Luke Zettlemoyer and Yulia Tsvetkov and Yejin Choi and David Evans and Hannaneh Hajishirzi},
  journal= {arXiv preprint arXiv:2402.07841},
  year   = {2024}
}

备注

Accepted at Conference on Language Modeling (COLM), 2024