中文

扩大成员推理攻击规模:攻击何时以及如何在大型语言模型上成功

计算与语言 2025-02-04 v2 人工智能 机器学习

摘要

成员推理攻击(MIA)试图验证给定数据样本是否存在于模型的训练集中。随着大型语言模型(LLM)的快速发展,MIA近年来变得重要。许多人担心受版权保护的材料被用于训练这些模型,并呼吁寻找检测此类使用的方法。然而,近期的研究大多得出结论,当前的MIA方法对LLM无效。即使它们看似有效,通常也是因为实验设计不当,存在其他捷径特征导致“作弊”。在这项工作中,我们认为MIA对LLM仍然有效,但仅在同时测试多个文档时。我们构建了新的基准,在从句子(n-gram)到文档集合(多个词元块)的连续数据样本规模上衡量MIA性能。为了验证当前MIA方法在更大规模上的有效性,我们采用了一项关于数据集推理(DI)的近期工作,用于二元成员检测任务,该任务聚合段落级别的MIA特征,以实现文档和文档集合级别的MIA。该基线方法在预训练和微调后的LLM上首次实现了成功的MIA。

引用

@article{arxiv.2411.00154,
  title  = {Scaling Up Membership Inference: When and How Attacks Succeed on Large Language Models},
  author = {Haritz Puerto and Martin Gubri and Sangdoo Yun and Seong Joon Oh},
  journal= {arXiv preprint arXiv:2411.00154},
  year   = {2025}
}

备注

Findings of NAACL 2025. Our code is available at https://github.com/parameterlab/mia-scaling