中文

面向大语言模型的语义成员推断攻击

机器学习 2024-06-17 v1

摘要

成员推断攻击(Membership Inference Attacks, MIAs)用于确定特定数据点是否包含在目标模型的训练集中。本文介绍了一种新的语义成员推断攻击方法(Semantic Membership Inference Attack, SMIA),该方法通过利用输入的语义内容及其扰动来增强攻击性能。SMIA 使用神经网络分析目标模型在扰动输入上的行为,有效捕捉成员与非成员之间输出概率分布的变化。我们在 Pythia 和 GPT-Neo 模型系列上使用 Wikipedia 数据集进行了全面评估。我们的结果表明,SMIA 在已有 MIAs 中显著优于现有方法;例如,在 Pythia-12B 上,SMIA 的 AUC-ROC 达到 67.39%,而第二名的攻击方法为 58.90%。

关键词

引用

@article{arxiv.2406.10218,
  title  = {Semantic Membership Inference Attack against Large Language Models},
  author = {Hamid Mozaffari and Virendra J. Marathe},
  journal= {arXiv preprint arXiv:2406.10218},
  year   = {2024}
}